Учёные из KAIST и Microsoft Research Asia разработали систему Neural Value Alignment, которая по сигналам мозга определяет, ошибся ли искусственный интеллект в понимании цели человека или выбрал неожиданный способ её достижения. Технология использует электроэнцефалографию и может передавать ИИ обратную связь в реальном времени.

Система Neural Value Alignment (NVA) анализирует данные электроэнцефалографии (EEG), чтобы фиксировать реакцию мозга в ситуациях, когда ИИ преследует неправильную цель или совершает неожиданное действие.

Исследователи решают проблему, которую называют неоднозначностью связи между целью и действием. Одно и то же действие может быть направлено на достижение разных целей, а одну и ту же цель можно реализовать несколькими способами.

Например, человек может взять чашку, чтобы выпить из неё, помыть, переставить или передать другому. Если он хочет утолить жажду, то может взять чашку, потянуться за бутылкой воды или попросить кого-то принести напиток.

NVA пытается различать такие ситуации по сигналам мозга. Учёные сосредоточились на двух типах реакций: ошибке предсказания вознаграждения (reward prediction error, RPE) и ошибке предсказания состояния (state prediction error, SPE).

RPE указывает на то, что ИИ неверно понял конечную цель. Например, человек может попросить домашнего робота принести что-нибудь выпить, подразумевая воду, а робот принесёт кофе. В этом случае мозг фиксирует несоответствие между ожидаемым и полученным результатом.

SPE возникает в другой ситуации: конечная цель распознана правильно, но ИИ выбирает неожиданный способ её достижения. Если робот понимает, что человеку нужна вода, но вместо бутылки с водой на столе идёт на кухню и наполняет чашку из-под крана, цель достигнута, однако действие отличается от ожидаемого.

В ходе экспериментов исследователи обнаружили различающиеся паттерны мозговых сигналов при этих двух типах ошибок. Затем они применили глубокое обучение для классификации EEG-сигналов и определения того, перепутал ли ИИ саму цель или способ её достижения.

Благодаря этому система может не только выявить проблему, но и скорректировать поведение ИИ в зависимости от типа полученной обратной связи.

Технология потенциально может применяться в домашних и промышленных роботах, автономных автомобилях, медицинских и реабилитационных системах, а также в образовательных технологиях. В будущем она может позволить машине понять, что человек недоволен её действиями, без необходимости прерывать работу и давать новую инструкцию.

«Это исследование важно, потому что показывает: ИИ может выйти за рамки определения человеческих намерений только по наблюдаемому поведению и напрямую использовать когнитивные сигналы, которые мозг формирует во время взаимодействия с ИИ», — прокомментировал руководитель исследования профессор Санг Уан Ли.

До сценария, в котором человеку достаточно взглянуть на робота, чтобы тот понял свою ошибку, ещё далеко. Систему продемонстрировали в симуляциях, а не на автономном роботе, который свободно перемещается в реальной среде и постоянно анализирует мозговые сигналы пользователя.

Кроме того, EEG использует электроды для измерения очень слабых электрических сигналов мозга. Эти данные могут быть зашумлены, а саму технологию сложно применять вне контролируемых лабораторных условий. Поэтому ещё предстоит оценить, насколько надёжно NVA работает при естественном взаимодействии с людьми, движении и непредсказуемых ситуациях.

Исследование опубликовано в журнале IEEE Transactions on Cybernetics.