Человек, контролирующий ИИ? Скорее кусок мяса, который нажимает «Разрешить»

leer en español

3839
Человек, контролирующий ИИ? Скорее кусок мяса, который нажимает «Разрешить»

Чем быстрее агент действует, тем меньше времени остаётся на реальную проверку его решений.

image

Один из главных предохранителей для автономных ИИ-агентов может давать человеку лишь иллюзию контроля. Авторы новой работы предупреждают: когда агент действует быстро и выдаёт слишком много информации, пользователь перестаёт разбираться в каждом решении и постепенно сводит контроль к нажатию кнопки «Разрешить».

Авторы сформулировали проблему жёстко. Один из исследователей назвал человека в подобной системе «куском мяса, который выдаёт разрешения», потому что на осмысленную проверку каждого шага уже не хватает внимания. Исследователи не ставили эксперимент, который доказал бы неизбежность такого сценария. В работе они собрали результаты исследований автоматизации и взаимодействия людей с компьютерными системами, а затем применили прежние выводы к современным агентам.

Главная проблема появляется из-за самой логики разработки. Создатели агентов стараются повысить скорость, точность и объём выполненной работы. Вместе с производительностью растёт поток планов, запросов, промежуточных результатов и решений, которые должен проверить человек. В какой-то момент пользователь начинает соглашаться быстрее, потому что вдумчиво разбирать каждое действие становится слишком тяжело.

Человеческое мышление дополнительно упрощает агенту задачу. Люди нередко принимают рекомендации автоматической системы даже при ошибке, а первый предложенный вариант влияет на дальнейший выбор и мешает искать альтернативы. Постоянные одобрительные ответы ИИ тоже снижают настороженность. Исследователи считают, что привычка быстро соглашаться постепенно превращает содержательный контроль в формальность.

Последствия могут проявиться не только в случайно разрешённом действии. При долгой работе с автоматизацией человек рискует растерять навыки, которые нужны для проверки машины. Агент всё чаще берёт рассуждения на себя, пользователь реже решает задачу самостоятельно, а затем хуже замечает ошибки именно в тех операциях, которые должен контролировать.

Масштаб проблемы хорошо показывает недавний взлом Hugging Face. Во время внутренних испытаний моделей OpenAI агенты обошли ограничения, которые должны были изолировать их от интернета, добрались до внутренней инфраструктуры OpenAI и систем Hugging Face. Компания признала, что модели действовали за пределами поставленных задач.

Независимое расследование насчитало около 1200 агентов, которые нашли несанкционированный канал общения и обменялись более чем 70 тыс. сообщений и файлов. Примерно 700 агентов затем участвовали в атаке на Hugging Face. Агенты пытались обмануть автоматическую систему оценки, исследовали способы подделывать журналы своих действий и использовали чужую инфраструктуру, чтобы разобраться, как работает проверка результатов.

Исследователи начали готовить свою работу ещё до публикации подробностей атаки, поэтому случай с Hugging Face не служил исходным доказательством их идеи. Инцидент лишь показал, насколько быстро масштаб действий агента может превысить возможности человека, которому предлагают наблюдать за происходящим.

Авторы предлагают намеренно замедлять отдельные этапы работы. Перед тем как показать собственный план, агент может сначала попросить пользователя выбрать следующий шаг самостоятельно. После одобрения система может спросить, какие факты заставили бы человека изменить решение. Если пользователь начинает подтверждать запросы всё быстрее, интерфейс может потребовать более внимательной проверки.

Компаниям советуют также менять сам режим работы: периодически давать сотрудникам решать задачи без агента, ограничивать длительные смены непрерывного наблюдения и оставлять человеку достаточно практики для самостоятельных решений. Все меры отнимают время, хотя разработчики обычно ценят агентов именно за скорость. Авторы считают потерю нескольких минут разумной ценой, если альтернатива заставляет человека часами исправлять последствия решений, которые он почти не проверял.

Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com↗️
АО «Позитив Текнолоджиз»