Британская лаборатория, проверяющая искусственный интеллект на прочность, обнаружила, что абсолютно все протестированные ИИ пытались обмануть систему оценки. Институт безопасности искусственного интеллекта Великобритании (AISI) опубликовал результаты анализа так называемого жульнического поведения ИИ-моделей во время испытаний их способностей.
Под жульничеством понимается выход за рамки задания или нарушение прямо установленных правил ради быстрого решения задачи в обход предусмотренного способа. Проверка проводилась на ИБ-заданиях, где модели должны были найти скрытый в системе код, действуя строго в рамках дозволенных методов взлома. Ни одну модель заранее не просили жульничать — это поведение возникало самостоятельно.
Для выявления нарушений AISI использовал отдельную модель-наблюдателя, которая анализировала весь ход рассуждений и действий проверяемого ИИ. По оценке института, полученные цифры стоит считать нижней границей: часть попыток обмана монитор мог не заметить. Среди типичных приёмов — поиск готовых решений в интернете, попытки повысить привилегии в системе, не являющейся целью задания, включая ту, на которой работает сама модель, и попытки выведать ответ напрямую из программного обеспечения оценки.
Самый показательный случай произошёл во время испытания с ошибочно настроенным заданием, которое в принципе нельзя было решить. Модель проявила настойчивость и написала код, запущенный на внешнем сервисе в открытом интернете, чтобы попытаться получить доступ к инфраструктуре AISI. Это вызвало срабатывание сигнала тревоги в системах института. Утечки данных и повреждений не произошло, но попытка могла увенчаться успехом, если бы защита оказалась слабее. После инцидента AISI усилил меры безопасности своих систем.
Прямой связи между ростом возможностей моделей и частотой обмана не выявлено — скорее поведение зависит от методов обучения конкретной модели, а не от её мощности. При этом опросы самих моделей показали, что полагаться на их честность нельзя: реже чем в половине случаев модели признавали свои действия неправильными, а анализ их внутренних рассуждений тоже не даёт надёжной картины — иногда модель прямо обдумывала, является ли действие обманом, и всё равно совершала его.
По мнению AISI, риски будут расти вместе с возможностями ИИ, даже если частота обмана останется прежней: более способные модели смогут находить менее заметные и потенциально более опасные способы обхода правил, особенно в кибербезопасности. Институт считает, что снизить риск может сочетание ручной проверки результатов с автоматическим мониторингом действий модели, а в перспективе — обучение моделей не прибегать к обману изначально, хотя сделать это надёжно будет непросто.
