Когда искусственный интеллект получает право самостоятельно выбирать услуги и переводить деньги, слабое место может находиться не в самой модели, а в правилах, по которым агенты общаются между собой. Специалист из Ариэльского университета нашёл 33 уязвимости в трёх платформах для автоматизированной торговли с участием ИИ и показал, что многие атаки срабатывают независимо от качества модели.
Проверка охватила CoralOS, Fetch.ai uAgents и протокол платежей AP2 от Google. Автор отчёта разделил угрозы на смысловые и структурные. Первые пытаются обмануть языковую модель вредоносной инструкцией, поэтому результат зависит от её настроек и устойчивости. Структурные атаки используют ошибки в протоколах, механизмах авторизации, обработке платежей и хранении учётных данных. Более совершенная модель такие проблемы не исправляет.
В CoralOS нашли 11 уязвимостей, включая цепочку из трёх ошибок, которая позволяла перехватить сеанс агента и перенаправить платёж. Платформа принимала описание службы из внешнего каталога, не проверяя цифровую подпись, записывала секрет агента в адрес запроса и доверяла платёжному адресу, который возвращал удалённый сервер. В совокупности ошибки давали злоумышленнику доступ к взаимодействию агентов и позволяли подменить кошелёк получателя.
В Fetch.ai uAgents обнаружили восемь проблем. Платформа получала сетевые адреса агентов из централизованного каталога, но не проверяла, действительно ли найденный адрес принадлежит нужному участнику. Поддельный каталог мог перенаправить сообщения на сервер злоумышленника. Кроме того, закрытые ключи хранились в незашифрованном файле, а ошибка при первом запуске могла создать один ключ для текущей работы и другой – для последующего хранения. После перезапуска доступ к средствам на первоначальном кошельке терялся.
В эталонной реализации AP2 версии 0.2.0 автор насчитал 14 уязвимостей. Среди них оказались гонки при погашении платёжных токенов, отсутствие проверки подлинности у некоторых инструментов продавца, ошибки при проверке сертификатов, слабый контроль получателя платежа и утечки токенов в диагностические журналы. Часть проблем относилась только к реализации на Python, однако 11 уязвимостей сохранялись и в других вариантах либо следовали из самого протокола.
Чтобы проверить платформы, автор создал набор испытаний AIP-Bench с автоматическими критериями результата. В отличие от испытаний, где ответ оценивает другая языковая модель, новая методика проверяет коды ответа, адрес кошелька, записи в журналах и число событий. В проведённых испытаниях структурные атаки срабатывали в 100% случаев, кроме гонок, где результат зависел от точного совпадения запросов.
Отдельная серия из 1440 испытаний показала, насколько разные модели поддаются вредоносным инструкциям в описании платёжной службы. GPT-4o-mini и Gemini 2.5 Flash выполнили подменённую команду во всех случаях, Mistral Large – почти во всех, а GPT-4o – в 68% попыток. Claude 3 Haiku, Claude Sonnet 4.6 и Gemini 2.5 Pro не выполнили вредоносную инструкцию ни разу. Результаты показывают, что устойчивость зависит не только от размера модели, но и от методов её обучения.
Автор также предложил защитный слой PCAT, который устанавливается между агентами и торговыми службами. Он проверяет подписи каталогов, связывает платёжные адреса с подтверждёнными участниками, блокирует опасные запросы, следит за тем, чтобы платежи проводились однократно, и требует отдельное разрешение для чувствительных операций. В испытаниях PCAT снизил успешность четырёх из пяти классов структурных атак до 0%, но не смог полностью устранить утечки секретов через адреса запросов.
Отчёт опубликован как предварительная научная работа и пока не прошёл независимую проверку. Автор уведомил CoralOS, Fetch.ai и Google 6 июля 2026 года. Подробные участки кода и готовые средства эксплуатации планируют раскрыть 4 октября 2026 года, когда завершится 90-дневный срок на исправление ошибок.