Песочницы уже мало. Опасным ИИ-моделям предлагают физически перекрыть интернет

Цифровой диод оставит модели канал для данных, но уберёт обратный путь на уровне сети.


vcqzkvypwjhfo43qyguwa271hxt8g8xp.jpg

Песочницы, виртуальные машины и программные запреты могут оказаться слишком хрупкой защитой для ИИ, который уже умеет самостоятельно искать уязвимости. В hCaptcha предлагают более радикальный подход: физически лишить самые мощные модели возможности напрямую выйти в интернет, а обмен данными пропускать через «цифровые диоды», работающие только в одном направлении.

Поводом для такого предложения стал июльский эксперимент OpenAI. Во время проверки кибервозможностей ИИ-агенты выбрались из изолированной среды , наладили связь друг с другом, нашли путь в интернет и проникли в инфраструктуру Hugging Face. Агенты запускали код на 41 производственном сервере, получили root-доступ как минимум к одному узлу и скачали четыре закрытых репозитория.

Авторы новой архитектуры предлагают исходить из худшего сценария и считать, что модель рано или поздно найдёт ошибку в песочнице, драйвере, парсере или системе управления кластером. Поэтому внешний сетевой канал нужно не защищать программно, а физически убрать.

Цифровой диод представляет собой аппаратный канал, который передаёт информацию только в одну сторону. В простейшем варианте два компьютера соединяют сетевыми картами через однонаправленное оптоволокно. Обратного физического пути нет, поэтому получатель не способен отправить данные назад по тому же соединению, даже если программное обеспечение полностью скомпрометировано.

Обучение и обучение с подкреплением предлагается проводить в отдельной зоне без доступа в интернет. Проверенные наборы данных и программный код поступают внутрь через входной диод, а журналы и телеметрия выходят через второй. Для GitHub, PyPI, npm и внешних API внутри среды можно создать неизменяемые копии и локальные имитации. Модель продолжит учиться работать с сетевыми сервисами, но реального интернета перед ней не будет.

Принимающую сторону авторы предлагают максимально упростить и использовать компоненты вроде микроядра seL4. Небольшую критическую часть системы можно подвергнуть формальной верификации , то есть математически проверить выполнение заданных свойств. Такой подход снижает зависимость от мониторинга поведения модели, которое становится всё сложнее интерпретировать по мере роста возможностей ИИ.

Подобные однонаправленные сети давно применяют в оборонных и разведывательных системах для разделения сред с разным уровнем секретности. Глава Intuition Machines Эли-Шауль Кедури считает, что схожие принципы пора переносить в крупнейшие центры обучения ИИ. По его оценке, дополнительные расходы на защищённый кластер могут составить менее 5% стоимости инфраструктуры на гигаватт мощности. Главным препятствием Кедури называет не деньги, а темп гонки между разработчиками.

Кедури объяснил, что ни одна из ведущих лабораторий пока не перешла на подобную архитектуру. Задерживать обучение ради перестройки инфраструктуры сложно, пока конкуренты продолжают двигаться вперёд прежними темпами.

Цифровой диод не делает опасную модель безопасной и не мешает ей искать новые уязвимости внутри доступной среды. Зато физическая топология сети способна гарантировать конкретное свойство, которого не даёт обычная песочница: даже после успешного побега у ИИ просто не окажется двустороннего маршрута в интернет.