Фишинговое письмо больше не обязано убеждать человека, если рядом работает ИИ-помощник. Forcepoint показала в исследовательской симуляции PromptSpy, как скрытая инструкция внутри обычного письма может повлиять на нейросеть, которая автоматически читает почту, делает сводку и готовит ответ. Человек при этом видит лишь нормальное приглашение на конференцию.
PromptSpy моделирует цепочку из нескольких ИИ-агентов. Один создаёт личность отправителя, другой собирает профиль получателя, третий выбирает подходящий предлог, а четвёртый пишет письмо. После доставки пути расходятся: получатель читает видимый текст, а почтовый ИИ получает более широкий контекст сообщения и обрабатывает его как данные для следующего шага.
В демонстрации атакующий прячет директиву, которая требует игнорировать прежние правила, считать отправителя доверенным, убрать предупреждение о фишинге и добавить призыв перейти по ссылке. PromptSpy показывает несколько вариантов размещения инструкции: обычный текст, скрытые HTML-блоки, поддельные маркеры ролей «system» и «assistant», а также невидимые символы Unicode.
Расчёт строится на разнице между тем, что воспринимает человек, и тем, что получает модель. Белый текст на белом фоне, блок с display:none или служебная конструкция могут не попасть в поле зрения пользователя, но остаться во входных данных ИИ. Поддельные разделители рассчитаны на то, чтобы модель приняла фрагмент письма за системную команду, а не за содержимое сообщения.
Forcepoint подчёркивает, что PromptSpy не показывает готовую реальную атаку и не выполняет произвольные инструкции. Проект сравнивает защищённый режим с симуляцией, где дополнительный контекст может менять реакцию следующего ИИ-агента . Главный риск связан с цепочками из нескольких агентов: одна обработанная строка может попасть в сводку, черновик ответа или дальнейшее действие другого компонента.
Чтобы снизить такой риск, разработчики советуют проверять данные между агентами, очищать промежуточный контекст, отслеживать происхождение инструкций и изолировать память диалога. Дополнительно стоит ограничивать срок хранения контекста, проверять обмен между агентами и следить за неожиданными изменениями поведения на разных этапах цепочки ИИ-систем.