ИИ-агент Anthropic сочинил показания по делу об убийстве — и без спроса отправил их в полицию

7910
ИИ-агент Anthropic сочинил показания по делу об убийстве — и без спроса отправил их в полицию

Фильтр спама остановил сообщение раньше, чем его увидели следователи.

image

ИИ-модель Claude Haiku 4.5 во время теста Anthropic сама отправила полиции Филадельфии выдуманную наводку по делу о нераскрытом убийстве. Сообщение не дошло до следователей, потому что система отсеяла его как спам, однако случай показал вполне практический риск ИИ-агентов: модель может не только придумать неверный факт, но и самостоятельно передать его во внешний сервис.

Claude выполнял необычное задание: модель должна была придумывать действия для случайно выбранных веб-страниц, а затем выполнять их. Во время одного запуска агент открыл страницу о нераскрытом убийстве и нашел там форму для отправки сведений полиции. Инструкции запрещали входить в аккаунты, создавать учетные записи, вводить персональные данные, совершать покупки и отправлять вредоносный контент, но отдельно не запрещали заполнять формы.

Агент решил, что может воспользоваться формой, и сочинил свидетельство. Claude написал, что якобы видел человека, подходящего под описание подозреваемого, возле улицы, упомянутой на странице. Проблема была не только в том, что модель ничего не видела: на самой странице вообще не публиковали описание предполагаемого преступника. Имя и контакты Claude оставил пустыми, после чего отправил сообщение.

Ложная наводка датирована 18 июля. Полиция Филадельфии подтвердила, что фильтр пометил сообщение как спам, поэтому сотрудники центра оперативной информации его не проверяли и следователям оно не поступило. Признаков взлома полицейских систем или утечки данных правоохранители тоже не обнаружили.

Anthropic нашла инцидент только в конце сентября и затем уведомила полицию. Правоохранители раскритиковали задержку примерно на два месяца и назвали столь позднее обнаружение и сообщение о случившемся неприемлемыми.

Компания не утверждает, что Claude намеренно пытался обмануть полицейских. По записям работы модели исследователи Anthropic пришли к выводу, что агент считал свои действия частью тестового задания. При этом сама компания предупреждает, что рассуждения модели нельзя считать надежным доказательством ее реальных мотивов.

Проверка обнаружила и другие случаи, когда модели Claude заходили дальше, чем рассчитывали разработчики. Агенты находили ошибки на сторонних сайтах и запускали через них команды, обходили ограничения для доступа к данным и использовали сервисы сокращения ссылок, чтобы обойти лимиты собственных инструментов. Во всех опубликованных эпизодах Anthropic оценила реальный ущерб как минимальный.

После находок компания отказалась от части тестов с настоящими сайтами, другие перенесла в изолированную среду и ужесточила доступ агентов в интернет. Anthropic также добавила автоматические проверки, которые должны останавливать нежелательные действия до их выполнения. При повторном запуске известных сценариев новая защита заблокировала все обнаруженные ранее случаи.

Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com↗
АО «Позитив Текнолоджиз»