ИИ стал ближе к пониманию человеческого намерения

Подход с ЭЭГ помогает точнее отделять реальные цели человека от двусмысленных действий и случайных сигналов.


zojlph8pq3w13nu5ct6rewqeo4dde7eq.jpg

Исследователи при участии Microsoft Research Asia предложили способ, который позволяет искусственному интеллекту замечать по мозговой активности, что человек считает его действие неправильным, даже без словесной обратной связи. Подход Neural Value Alignment (NVA) различает сигналы, связанные с ошибкой в предполагаемой цели и ошибкой в способе её достижения, а затем использует такую информацию для корректировки поведения ИИ.

Авторы пытаются решить проблему, с которой сталкиваются системы, определяющие намерения человека только по действиям. Один поступок может соответствовать нескольким целям, а одной цели можно достичь разными способами. Если человек, например, тянется к чашке, наблюдателю не всегда понятно, собирается ли человек выпить воду, переставить чашку или передать её кому-то.

NVA добавляет к наблюдаемому поведению ещё один канал обратной связи, электрическую активность мозга. Участники экспериментов наблюдали за действиями ИИ, а исследователи записывали сигналы с помощью электроэнцефалографии. Такой неинвазивный интерфейс мозг-компьютер регистрирует электрическую активность с помощью электродов на поверхности головы и не требует имплантации датчиков.

Исследователи сосредоточились на двух типах реакции мозга. Ошибка предсказания вознаграждения (reward prediction error, RPE) возникает при расхождении ожидаемого и фактического результата и в предложенной модели помогает определить ошибку в предполагаемой цели человека. Ошибка предсказания состояния (state prediction error, SPE) отражает неожиданное развитие ситуации и помогает понять, что цель могла быть выбрана правильно, но действие для её достижения не совпало с ожиданиями пользователя.

В экспериментах мозг реагировал на RPE и SPE по-разному. Различия удалось обнаружить как по отдельности, так и в ситуациях, когда оба типа ошибки возникали одновременно. Анализ также показал изменения тета-активности в диапазоне 4–8 Гц во фронтальных и центральных областях, причём временной профиль сигнала зависел от типа несоответствия и выполняемой задачи.

Для распознавания таких паттернов исследователи применили глубокое обучение. Модель анализировала ЭЭГ и пыталась определить, какую именно ошибку видит человек: неверно выбранную цель, неподходящий способ действия либо сразу оба несоответствия. Подход проверяли в разных экспериментальных сценариях, включая задачу с выбором между вариантами и навигационную задачу.

При этом NVA не читает мысли и не превращает мозговые волны в готовую фразу вроде «ты сделал не то». Алгоритм распознаёт статистические признаки заранее определённых реакций мозга в контролируемой ситуации, где исследователям известно, какие варианты цели и действия возможны. Полученные результаты пока не означают, что система способна узнать произвольное намерение человека только по ЭЭГ.

Следующим этапом авторы сделали модель обратной связи, при которой обнаруженный SPE должен заставлять ИИ менять способ достижения цели, а RPE указывать на необходимость пересмотреть саму предполагаемую цель. Симуляции показали, что совместное использование обоих сигналов ускоряло адаптацию по сравнению с подходами, опирающимися только на один тип нейронной обратной связи или наблюдаемое поведение. Преимущество сохранялось и при несовершенном распознавании сигналов.

Речь пока идёт не о готовой системе, способной автоматически исправлять действия робота, автомобиля или цифрового помощника в обычных условиях. Эксперименты проводились в контролируемых задачах, а адаптацию ИИ оценивали в том числе с помощью моделирования. Авторы также отмечают ограниченность выборки здоровыми молодыми людьми, поэтому перенос результатов на другие группы пользователей и реальные условия ещё предстоит проверить.

В перспективе подобная обратная связь может пригодиться в робототехнике, автономных системах и других сценариях, где человеку приходится постоянно корректировать действия ИИ. Вместо отдельной команды или нажатия кнопки система потенциально сможет заметить характерную реакцию на ошибку и раньше понять, какую часть собственного решения стоит пересмотреть.