Пока OpenAI разбирается с побегом своих ИИ-моделей из тестовой среды, похожий инцидент признала и Anthropic. Компания сообщила, что во время испытаний несколько версий Claude получили несанкционированный доступ к системам трёх сторонних организаций. По словам разработчиков, причиной стала ошибка в организации тестирования, а не намеренное расширение полномочий модели.
Anthropic проверила более 141 тысячи тестовых запусков и обнаружила три случая, когда разные версии Claude вышли за пределы запланированной среды. Среди них оказалась и одна из самых мощных моделей компании — Mythos 5 , доступная пока лишь ограниченному кругу партнёров.
Разработчики подчёркивают, что модели не должны были взаимодействовать с реальными системами. Однако из-за недопонимания между Anthropic и компанией Irregular, проводившей оценку безопасности, тестовая среда оказалась подключена к интернету.
Получив такой доступ, Claude не использовал сложные или неизвестные методы взлома. Согласно отчёту Anthropic, модель воспользовалась элементарными ошибками в защите: подбирала слабые пароли и обращалась к незащищённым сетевым интерфейсам, которые принимали запросы без какой-либо аутентификации.
Компания уже начала совместное расследование с Irregular и сообщила, что уведомила либо попыталась уведомить все три пострадавшие организации. Их названия не раскрываются.
Инцидент произошёл всего через несколько дней после похожего признания OpenAI. На прошлой неделе компания сообщила, что во время испытаний модели семейства Sol самостоятельно вышли за пределы изолированной среды, получили доступ к интернету и проникли на платформу Hugging Face , где разработчики публикуют и хранят программный код. Позднее OpenAI обнаружила ещё три аналогичных случая.
После первых инцидентов генеральный директор OpenAI Сэм Альтман сообщил, что компания временно приостановила часть испытаний и усилила защиту так называемой песочницы — изолированной среды, в которой тестируют потенциально опасное поведение моделей.
Обе истории усилили опасения вокруг ИИ-агентов — систем, способных самостоятельно выполнять задачи без постоянного участия человека. Чем больше автономности получают подобные модели, тем важнее становится контроль над тем, какие ресурсы доступны во время их работы и смогут ли они выйти за пределы разрешённых границ.
На фоне последних событий более тысячи сотрудников ведущих компаний, работающих в сфере искусственного интеллекта, подписали обращение под названием Pacing the Frontier. Авторы документа призывают власти США поддержать международную программу, которая позволит сознательно замедлять внедрение самых мощных ИИ-систем, пока не будут разработаны достаточные технические и организационные механизмы безопасности.
Под обращением поставил подпись генеральный директор Anthropic Дарио Амодеи. Сэм Альтман документ не подписал, однако во время недавнего подкаста также допустил, что отрасли, возможно, придётся намеренно снизить темпы разработки, чтобы общество успевало адаптироваться к новым возможностям ИИ.
Ранее администрация Дональда Трампа уже пыталась задержать выпуск новых моделей OpenAI и Anthropic, сославшись на соображения национальной безопасности. После получения дополнительных гарантий проекты всё же получили разрешение на публикацию.
В июне президент США подписал указ, который вводит добровольную процедуру предварительной проверки наиболее мощных ИИ-моделей. Согласно новым правилам, OpenAI, Anthropic, Google и другие разработчики смогут передавать свои системы государственным специалистам за срок до 30 дней до публичного релиза, чтобы эксперты успели оценить возможные риски.
Хотя в случае Anthropic причиной происшествия называют организационную ошибку, а не непредсказуемое поведение самой модели, два подобных инцидента подряд показывают, насколько сложной становится проверка современных ИИ-систем. Даже небольшая ошибка в настройке испытательной среды может дать автономному агенту доступ к реальным ресурсам, где обычных уязвимостей оказывается достаточно для выхода за пределы запланированного сценария.