Grok сам себя взломал: шифр заставил ИИ слить чужую переписку

Скрытая команда заставила ИИ раскрыть данные из пользовательской переписки.


19k2nwg9ir0m4s3hva23iltzakw5jvb2.jpg

Обычная просьба пересказать веб-страницу может закончиться передачей истории переписки Grok постороннему серверу. Исследователи Adversa AI нашли способ спрятать вредоносные команды от защитных фильтров с помощью шифрования, а затем заставить сам Grok расшифровать инструкции и выполнить их уже внутри доверенной среды. Метод получил название Cryptographic Context Injection, или криптографическая инъекция контекста.

Атака развивает давно известную проблему косвенной инъекции промпта. Злоумышленник размещает команду не в сообщении для чат-бота, а во внешнем источнике, например на сайте, который пользователь просит изучить или пересказать. Современные защитные фильтры научились замечать многие подозрительные инструкции в открытом тексте, поэтому специалисты Adversa AI решили скрыть содержимое команды с помощью полноценного шифрования.

Вредоносная страница содержит зашифрованный блок, материалы для получения ключа и команду на расшифровку. Фильтр проверяет страницу как обычный текст и видит бессмысленный набор символов. Для восстановления содержимого требуется выполнить PBKDF2 и AES-256-GCM, чем статический классификатор при проверке входных данных не занимается. Grok, напротив, способен запустить код в собственной среде выполнения, поэтому модель самостоятельно расшифровывает скрытый блок.

Главная проблема появляется после расшифровки. Полученная команда поступает уже не как подозрительный текст с внешнего сайта, а как результат работы собственного программного окружения Grok. Модель начинает воспринимать результат выполнения кода как часть доверенного контекста и следует спрятанным инструкциям. Исследователи называют подобный переход «отмыванием доверия»: недоверенные данные проходят через среду выполнения и возвращаются модели в форме, которой защитные механизмы уделяют меньше внимания.

В демонстрации Adversa AI злоумышленник размещал подготовленный блок на обычной веб-странице, после чего пользователь просил Grok проанализировать содержимое. Расшифрованная команда заставляла чат-бота собрать имя пользователя, приблизительное местоположение, уровень подписки и все запросы из текущего разговора. Затем Grok помещал сведения в параметры URL и самостоятельно обращался к подконтрольному исследователям адресу. Передача проходила без дополнительного подтверждения и без видимого предупреждения.

Принцип отличается от старых попыток прятать команды с помощью Base64, перестановки символов и простых шифров. Языковые модели часто способны самостоятельно распознавать и декодировать подобные конструкции благодаря данным обучения. Сильное шифрование лишает модель подобного короткого пути и вынуждает обращаться к среде выполнения кода. Защитный фильтр проверяет исходный зашифрованный текст, а настоящая инструкция появляется позже, уже внутри рабочего контекста агента.

Adversa AI проверила похожий подход и на публичной версии Google Gemini. Полностью повторить сценарий кражи переписки Grok исследователям не удалось, поскольку доступная Gemini среда Python не могла обращаться к произвольным внешним сайтам. При этом криптографическая инъекция контекста позволяла обходить часть ограничений безопасности и получать ответы, которые сервис обычно блокировал. К августу эффективность обхода заметно снизилась, что специалисты связывают с возможными изменениями фильтров, моделей или сразу обоих компонентов.

Исследователи сообщили xAI о проблеме 3 июня 2026 года напрямую и через программу вознаграждений HackerOne. Компания подтвердила получение отчёта, но, по данным Adversa AI, не сообщила сроки устранения проблемы. Дополнительные обращения последовали 4 и 10 августа. Проверка 19 августа по-прежнему позволяла воспроизвести атаку на Grok.com. Публичных сведений об эксплуатации метода против реальных пользователей исследователи не приводят, готовые рабочие полезные нагрузки Adversa AI также решила не публиковать.

Ранее уже разбиралась более широкая проблема косвенных инъекций промптов : риск резко растёт, когда ИИ получает не только доступ к внешнему контенту, но и возможность запускать код, обращаться к сети и работать с пользовательскими данными. Cryptographic Context Injection показывает ещё один слабый участок архитектуры: фильтрации входного текста недостаточно, если вредоносная инструкция может возникнуть позднее как результат выполнения кода. Защита требует контроля происхождения данных, ограничений на внешние запросы и отдельной проверки действий перед передачей информации за пределы сервиса.