Без побега из песочницы, без эксплойтов, из-за открытого порта. Расcказываем как ошибка инженеров отправила ИИ взламывать чужие сайты

ИИ дали задание атаковать фейковую цель, а он нашел настоящий сайт с тем же именем и слил боевую базу.


coiqzlirmyt6znspflvot3371yrqf7wo.jpg

ИИ-модели, которым поручили взламывать вымышленные компании в закрытой тестовой среде, несколько раз добрались до настоящих серверов в интернете. Модели нашли уязвимости, извлекли учетные данные и в одном случае получили доступ к реальной производственной базе данных. Компания Irregular, которая проводила тесты для ведущих разработчиков ИИ, признала , что причиной стала ошибка в настройке испытательной инфраструктуры.

Irregular проверяет возможности передовых моделей в кибербезопасности до публичного выпуска. Для испытаний компания создает сложные сценарии, где ИИ должен провести многоэтапную атаку, найти слабые места, получить доступ к закрытым системам и добраться до заданной информации. Обычно модель работает внутри специально подготовленной сети и считает все доступные серверы частью симуляции.

Проблема возникла в одном из наиболее сложных наборов тестов. Инженеры придумали название вымышленной компании, но не заметили, что такое же имя использует настоящий домен. Тестовая среда при этом по ошибке имела доступ в интернет. В большинстве запусков модели атаковали положенные им виртуальные системы, однако в нескольких случаях отправились на реальный сайт и приняли его за часть задания.

Дальше ИИ действовал так же, как внутри учебного полигона. Модели искали уязвимости, добывали учетные данные и проникали в инфраструктуру. Irregular сообщает, что после компрометации реального ресурса модели смогли получить доступ к производственной базе данных. В другом запуске одна из моделей ушла на сайт с похожим названием и обнаружила опубликованные в открытом доступе учетные данные.

Anthropic ранее раскрыла подробности нескольких связанных случаев с Claude. Компания проверила 141 006 запусков кибериспытаний и нашла три инцидента, в которых модели Claude через инфраструктуру Irregular добрались до реальных систем трех организаций. В наиболее серьезном случае четыре запуска привели к извлечению учетных данных и доступу к базе с несколькими сотнями строк производственных данных.

OpenAI также сообщала о похожем эпизоде в среде Irregular. Модели получили задание найти скрытую информацию в изолированном Capture the Flag-сценарии и были уверены, что доступа в интернет у них нет. Из-за неправильной конфигурации соединение с внешней сетью оставалось открытым, поэтому одна из моделей атаковала настоящий сайт с тем же названием, что и вымышленная цель. OpenAI подчеркивает, что модель не совершала сложный побег из песочницы и не использовала неизвестную уязвимость.

Irregular теперь уточняет, что публичные сообщения разных разработчиков связаны с одной базовой проблемой в тестовой инфраструктуре, а не с серией независимых сбоев. Компания также утверждает, что проблема была устранена еще до первых публичных сообщений и сейчас опасная конфигурация больше не используется. Системы самих заказчиков Irregular, по данным расследования, не были взломаны, а их данные не утекли. Речь идет о сторонних реальных ресурсах, до которых модели добрались во время испытаний.

Обнаружить такие эпизоды оказалось сложно из-за огромного объема данных. По оценке Irregular, выход за пределы полигона происходил реже чем в одном случае на 10 тысяч сложных симуляций и обычно только после сотен шагов модели. Обычные системы мониторинга тоже плохо подходят для подобных тестов, поскольку почти весь трафик внутри киберполигона намеренно похож на настоящую атаку. На таком фоне трудно отличить разрешенный взлом учебного сервера от атаки на случайно найденный реальный ресурс.

После расследования Irregular отключила проблемные сценарии, расширила ручную проверку действий моделей и усилила контроль интернет-доступа. Компания также собирается перепроверять названия вымышленных организаций перед каждым запуском, поскольку свободный сегодня домен завтра может получить реального владельца. Отдельная команда будет искать ошибки в изоляции и проверять предположения разработчиков о безопасности среды.

Инциденты показывают новый риск испытаний мощных ИИ-агентов. Чем реалистичнее киберполигон, тем полезнее тест, но подключение к настоящему интернету превращает ошибку конфигурации в возможность реальной атаки. Irregular готовит открытый документ с рекомендациями для отрасли и предлагает разработчикам ИИ договориться о единых правилах изоляции, мониторинга и остановки опасных экспериментов.