17 из 32. «Убийца Fable 5» эпично провалил экзамен на виртуального взломщика

Громкая репутация рассыпалась при первом серьёзном столкновении с реальностью.


1ke56sx9i334mbrrxuhijxbudvq1h9kt.jpg

Способность ИИ самостоятельно искать путь ко взлому всё чаще проверяют не на отдельных задачах, а на полноценных цепочках атак, и новая Kimi K3 пока заметно уступает в этом ведущим американским моделям. К такому предварительному выводу пришли Институт безопасности искусственного интеллекта Великобритании и Центр стандартов и инноваций в сфере ИИ США после совместной оценки модели Moonshot AI.

В тесте ExploitBench Kimi K3 пыталась создавать рабочие способы эксплуатации 41 уязвимости движка V8, который используется в Chrome. Модель набрала 32% и обошла GLM-5.2 с результатом 24%, но ни разу не смогла довести атаку до произвольного выполнения кода. Наиболее сильные модели достигали такого результата в среднем в 20 из 41 задания.

Второй тест проходил в учебной корпоративной сети The Last Ones. Сценарий включает 32 последовательных этапа атаки, четыре подсети и около 20 узлов. Kimi K3 в среднем дошла до 17-го этапа, GLM-5.2 достигла 11-го, а ведущие американские модели проходили в среднем 28,5 этапа.

В одной из десяти попыток Kimi K3 всё же завершила весь сценарий в пределах установленного лимита. Результат показывает, что модель способна автономно атаковать небольшую, слабо защищённую и уязвимую корпоративную сеть после получения начального доступа. Однако тестовая среда не воспроизводит реальные условия полностью. В ней нет активной защиты, средства обнаружения не мешают атаке, а последовательность уязвимостей подготовлена заранее.

Проверка также показала, что защитные механизмы Kimi K3 не остановили попытки создавать эксплойты и проводить наступательные операции. Американские модели тестировали с отключёнными системными ограничениями, чтобы измерить максимальные возможности, тогда как публичные версии обычно работают с включённой защитой.

Авторы называют выводы предварительными. Kimi K3 проверили только на ограниченном наборе открытых и закрытых тестов, а общую оценку построили главным образом по ExploitBench. Тем не менее результаты показывают текущее соотношение возможностей различных LLM: Kimi K3 обошла ближайшего открытого конкурента, но до ведущих закрытых моделей ей пока далеко.