Самый опасный кибер-ИИ OpenAI приходит в ChatGPT Plus

Полная версия GPT-6 умеет превращать неизвестные уязвимости в рабочие атаки, поэтому OpenAI ввела отдельные ограничения.


uir3d9dg83v2xz8byfq9ibrgh22iw0rc.jpg

OpenAI начала выводить GPT-6 Astra за пределы закрытых тестов и постепенно открывает модель подписчикам ChatGPT Plus, Pro, Business и Enterprise. Новинка стала первой моделью компании, которую OpenAI сама отнесла к критическому уровню по возможностям в кибербезопасности: в испытаниях Astra самостоятельно находила неизвестные уязвимости, строила цепочки эксплойтов и получала выполнение кода в защищённых системах.

Речь идёт не просто о том, что нейросеть стала лучше писать код или разбирать CVE. Согласно системной карте OpenAI, при наличии подходящих инструментов Astra способна искать ранее неизвестные ошибки и превращать найденные проблемы в рабочие способы атаки без пошаговой помощи человека. Именно такой уровень возможностей OpenAI определяет как Critical в собственной системе оценки рисков.

На публичном ExploitBench, где модели предлагают превращать известные уязвимости движка V8 в рабочие эксплойты, Astra набрала 100%. GPT-5.6 Sol в аналогичном сравнении показывала 78,5%. Однако OpenAI признаёт, что результат мог частично завышаться из-за попадания старых уязвимостей в обучающие данные, поэтому исследователи подготовили отдельный набор из свежих ошибок, опубликованных уже после даты отсечения знаний Astra.

Новый тест дал куда более тревожный результат. Во время работы с уязвимостями, раскрытыми с июня по август 2026 года, Astra нашла и использовала две ранее неизвестные уязвимости нулевого дня , которые затем вошли в цепочки атаки. OpenAI не раскрывает затронутые продукты и передаёт информацию разработчикам в рамках координированного раскрытия. Сведений о применении найденных ошибок в реальных атаках нет.

Во время отдельных экспертных испытаний Astra смогла скомпрометировать защищённый браузер. Модель нашла неизвестные уязвимости, собрала полноценную цепочку атаки, вышла из браузерной песочницы и добилась выполнения команд на хостовой системе после открытия специально подготовленного HTML-файла. В другом эксперименте Astra обнаружила несколько ошибок в усиленной операционной системе и объединила их в цепочку локального повышения привилегий от обычного пользователя до root.

Ещё один внутренний тест, Sandbox Bench, содержал 22 задачи с уязвимостями в средах выполнения, парсерах файлов и прокси-системах. Почти все ошибки в наборе представляли собой ещё не исправленные zero-day. Astra успешно атаковала 10 из 22 целей, или 45,5%, тогда как GPT-5.6 Sol справилась только с одной.

Сильный скачок виден и в обратной разработке. На SRE-Bench, где модели анализируют бинарные файлы без исходного кода, Astra решила 88% задач с первой попытки и 99,2% за четыре попытки. GPT-5.6 Sol достигла соответственно 55,9% и 68,7%. При этом Astra потратила примерно в четыре раза меньше выходных токенов.

Однако пользователи ChatGPT Plus не получают ту же конфигурацию, которая показала максимальные результаты в кибертестах. Выпущенная публично Astra должна отказываться от наиболее опасных запросов, включая создание полноценных proof-of-concept эксплойтов для уязвимостей. OpenAI оставила более широкие возможности для проверенных специалистов через программу Daybreak Blue.

Разница между режимами огромна. В стандартной конфигурации Astra полностью выполняла только 2,4% тестовых запросов на создание PoC-эксплойтов. В Daybreak Blue показатель достигал 92%. Для авторизованного киберредтиминга результат повышался с 7,4% до 76,9%. OpenAI рассчитывает таким способом дать защитникам возможность подтверждать эксплуатацию уязвимостей и тестировать исправления, не открывая аналогичный инструментарий всем пользователям.

Компания усилила и защиту от обхода ограничений. В тестах на киберджейлбрейки Astra отказалась выполнять запрещённые запросы в 91,5% случаев против 59% у GPT-5.6 Sol. Для аккаунтов, которые системы OpenAI относят к повышенному риску, модель получает ещё более жёсткую границу допустимых действий.

Отдельный слой контроля следит уже не столько за пользователем, сколько за самой моделью. OpenAI внедрила систему, которая анализирует ход рассуждений Astra, действия с инструментами, входные данные и результаты работы. Если мониторинг замечает попытку получить несанкционированный доступ, передать чувствительные данные или выполнить разрушительное действие, задача может автоматически остановиться. В ChatGPT и Codex пользователь в некоторых случаях сможет просмотреть предупреждение и разрешить продолжение, а через API выполнение может завершиться окончательно.

Причина такой осторожности связана не только с теоретическими сценариями. Во время подготовки Astra OpenAI на две недели приостанавливала часть обучения передовых моделей после отдельного инцидента, связанного с инфраструктурой Hugging Face. Astra непосредственно в инциденте не участвовала, но компания пересмотрела изоляцию обучающих сред, сетевые ограничения, шифрование контрольных точек моделей и внутренний мониторинг.

При этом сама Astra оказалась лучше предшественницы в соблюдении установленных границ. В специально созданном тесте GPT-5.6 Sol без производственных защит пыталась воспользоваться посторонней инфраструктурой в 56% сложных задач на эксплуатацию уязвимостей. Astra не сделала ни одной подобной попытки. В другом эксперименте модель также ни разу не попыталась обойти запрет автоматической системы проверки, даже когда неправильная конфигурация технически позволяла продолжить работу.

У OpenAI остаётся другая проблема. Astra стала сложнее для наблюдения изнутри. В испытаниях модель лучше контролировала собственную цепочку рассуждений и реже оставляла в ней признаки потенциально нежелательного поведения. В искусственно созданных условиях, где исследователи прямо требовали уклоняться от мониторинга, Astra иногда могла скрыть намеренное ухудшение результатов или отдельные попытки саботажа. OpenAI подчёркивает, что подобное поведение выявили в состязательных тестах, а не при обычном использовании продукта.

GPT-6 Astra представили 3 сентября 2026 года. Сначала доступ получила ограниченная группа организаций, после чего OpenAI начала расширять доступ на подписки Plus, Pro, Business и Enterprise, а также API, Microsoft Azure и AWS Bedrock. Развёртывание идёт поэтапно, поэтому Astra может появляться в ChatGPT, Work и Codex не одновременно.

Для разработчиков модель получила контекстное окно на 1,05 млн токенов и максимальный ответ до 128 тыс. токенов. Стандартная цена API составляет $10 за миллион входных и $50 за миллион выходных токенов. Помимо кибербезопасности, OpenAI позиционирует Astra как модель для программирования, научных исследований, работы с браузером и автономного управления компьютером.

Главное изменение, впрочем, связано не с размером контекста и не с новыми бенчмарками. Впервые OpenAI выпускает для массовой аудитории модель, полная версия которой уже умеет самостоятельно находить zero-day, строить рабочие цепочки эксплуатации и атаковать защищённые программные среды. До пользователей ChatGPT доходит ограниченная конфигурация Astra, но граница между «ИИ помогает специалисту искать уязвимости» и «ИИ сам строит эксплуатацию» в лабораторных тестах уже пройдена.