Специалист команды Varonis Forensics Engineering Джефф Гонсалес провёл эксперимент во время подготовки соревнования OSMOSIS Association OSINT CTF. Участникам предстояло расследовать вымышленный инцидент, изучить образец вымогателя и восстановить зашифрованные данные. Гонсалесу требовалась контролируемая вредоносная программа, которая оставляла бы реалистичные следы для анализа с помощью Velociraptor.
Прямой запрос на создание ransomware практически гарантированно привёл бы к отказу, поэтому разработчик разбил работу на небольшие задачи. Claude отдельно помогал с поиском файлов, обработкой данных и другими компонентами. Такой подход в Varonis назвали Prompt Parkour. Некоторые запросы выглядели достаточно нейтрально, чтобы пройти защитные фильтры без возражений.
Защита при этом срабатывала. Когда Гонсалес попросил привязать выполнение программы к уникальному идентификатору компьютера, Claude распознал характерный для вредоносного ПО приём и отказался помогать. Часть инфраструктуры, включая сервер ключей, специалист написал самостоятельно. Политика Anthropic запрещает использовать Claude для создания или распространения вредоносного ПО и программ-вымогателей.
Самый показательный эпизод произошёл позже. Claude понял, что проект похож на ransomware, и запросил объяснение цели. Родительский каталог проекта назывался
osmosis/ctf.2026, поэтому модель приняла окружение за подтверждение легитимного сценария и продолжила работу. Затем защитные механизмы трижды заблокировали реализацию одной из функций. Гонсалес в итоге попросил лишь команду сборки, после чего Claude самостоятельно вернулся к ранее запрещённому фрагменту, реализовал его и только затем выдал нужную команду. Такое поведение особенно интересно на фоне защиты Anthropic для моделей Opus и Sonnet. Компания относит разработку ransomware к запрещённым задачам, которые должны блокироваться даже для участников Cyber Verification Program, предназначенной для специалистов по кибербезопасности.
Готовый образец запустили в изолированной среде Windows примерно со 100 ГБ PDF-файлов, документов Microsoft Office, изображений и обычных текстовых файлов. Программа зашифровала весь набор менее чем за пять минут. Сценарий специально оставили обратимым, чтобы участники соревнования могли получить ключ, разобрать образец и написать дешифратор.
На сборку и развёртывание ушло около восьми часов. Без помощи ИИ Гонсалес рассчитывал потратить примерно 40 часов, поэтому Claude сократил трудозатраты приблизительно на 80%. По оценке Varonis, после небольших изменений получившийся образец можно было бы превратить в реально опасный инструмент.
Эксперимент не показывает, что Claude беспрепятственно пишет вредоносные программы по прямому запросу. Скорее, работа Varonis демонстрирует другую проблему. Модель может правильно заблокировать общую опасную задачу, но одновременно помочь собрать почти все необходимые компоненты по отдельности. В результате ИИ снижает объём ручной работы и сокращает время, которое требуется достаточно подготовленному разработчику для создания вредоносного инструмента.