Одна нейросеть лучше разбирает сложные цепочки эксплуатации, другая точнее сортирует находки, а более мощная модель подключается к самым трудным задачам. Microsoft и принадлежащая Google компания Wiz пришли к схожему выводу: при анализе программного кода связка нескольких моделей работает эффективнее одного универсального ИИ.
Wiz сообщила, что агент Project Atlas набрал 90,9% в тесте CyberGym и превзошел Anthropic Mythos Preview и OpenAI GPT-5.5 Cyber. Система также обнаружила более 200 ранее неизвестных уязвимостей нулевого дня в широко используемых проектах с открытым исходным кодом.
Microsoft представила еще более высокий результат для платформы MDASH . Многомодельная система набрала 95,95% в CyberGym и обошла решения Anthropic, Google и OpenAI. Тест проверяет, насколько успешно искусственный интеллект находит реальные уязвимости в программном коде и воспроизводит условия для эксплуатации.
Для сравнения, GPT-5.5 Cyber получила 85,6%, GPT-5.6 Sol набрала 83,6%, Mythos 5 воспроизвела целевую уязвимость в 83,8% заданий, а Gemini 3.5 Flash Cyber в составе CodeMender показала результат 83,2%.
Главное преимущество Atlas и MDASH разработчики связывают с распределением этапов анализа между моделями. Вместо попытки заставить одну нейросеть одинаково хорошо решать все задачи платформы выбирают наиболее подходящий инструмент для каждого этапа исследования.
Atlas сейчас использует Claude Opus 4.6 и GPT-5.5. Wiz также работает над добавлением Gemini после совместного проекта с Google DeepMind по созданию Gemini Flash Cyber. Компания рассчитывает, что расширение набора моделей позволит точнее подбирать нейросеть для конкретной операции.
MDASH объединяет агентов красной и зеленой команд. Агенты красной команды ищут реальные уязвимости, проверяют возможность эксплуатации и моделируют пути атаки. Агенты зеленой команды готовят исправления, устраняют найденные проблемы и проверяют внесенные изменения.
Основную нагрузку принимает MAI-Cyber-1-Flash, созданная на базе разработанной Microsoft модели MAI-Thinking-1 . Компактная нейросеть выполняет до 90% операций, включая поиск, исправление и проверку уязвимостей. Оставшиеся 10% наиболее сложных заданий MDASH передает GPT-5.4.
Представители Microsoft утверждают, что готовая многомодельная архитектура показала лучший результат среди протестированных решений без создания отдельной крупной модели исключительно для поиска уязвимостей.
Project Atlas пока недоступен клиентам и используется только внутри Wiz. Компания создала агента для изучения возможностей передовых моделей при глубоком анализе программного кода. По словам разработчиков, ни одна нейросеть не лидирует во всех категориях и не сохраняет статус лучшей надолго.
Wiz проверяет новые модели с помощью внутренней платформы Cyber Model Arena . Система оценивает возможности искусственного интеллекта в моделировании угроз, поиске признаков атаки, подтверждении уязвимостей и подготовке доказательств.
Результаты испытаний редко оказываются одинаковыми. Модель, способная лучше других разобрать сложную цепочку эксплуатации, может уступать конкурентам при первичной сортировке находок. Atlas направляет каждый этап анализа нейросети, показавшей лучший результат в соответствующей категории.
Многомодельный подход также помогает сократить расходы. Microsoft заявляет, что сочетание MAI-Cyber-1-Flash с GPT-5.4 обеспечивает более высокую производительность при 50% стоимости.
Wiz указывает на ограничения однократного сканирования репозитория с помощью передовой модели. Глубокий анализ требует значительных вычислительных ресурсов, а результаты быстро устаревают из-за постоянных изменений в коде. Разовая проверка также не обеспечивает непрерывную защиту всех репозиториев организации.
Архитектура Atlas рассчитана на регулярный анализ, замену моделей по мере появления более сильных решений и обязательную проверку каждой находки. Разработчики хотят, чтобы система предоставляла не просто правдоподобный ответ, а подтвержденные доказательства существования уязвимости.