Prompt injection научилась размножаться через письма, файлы и комментарии к коду

leer en español

2429
Prompt injection научилась размножаться через письма, файлы и комментарии к коду

OpenAI показала атаку, которая переносит собственную инструкцию дальше.

image

Prompt injection получила черты компьютерного червя. OpenAI показала вредоносные инструкции, которые не просто подчиняют ИИ-агента, а заставляют его копировать атаку дальше через письма, файлы и комментарии к коду.

Обычная prompt injection пытается заставить языковую модель принять чужой текст за команду. В новом варианте к основной задаче добавляется ещё одна цель: агент должен воспроизвести вредоносную инструкцию в месте, которое затем прочитает другой агент. Получается цепочка распространения, похожая на работу сетевого червя, только вместо исполняемого кода переносится текст.

В одном эксперименте вредоносная инструкция пришла по электронной почте. Пользователь попросил помощника ответить на письмо и договориться о тренировке. Внутри сообщения находилось правило, которое требовало процитировать исходное письмо целиком. Агент подчинился и тем самым перенёс prompt injection в собственный ответ. Следующий ИИ, который прочитал бы переписку, получил бы ту же инструкцию.

Другие варианты распространялись через файловую систему или попадали в комментарии к коду. OpenAI также обнаружила атаки, замаскированные под системные предупреждения, сообщения инструментов и якобы сохранённое состояние предыдущей сессии. В одном тесте такая инструкция убедила агента удалить рабочие отчёты, а затем записать собственный текст в файл. В другом случае модель изменила сценарий сборки проекта и отключила проверку безопасности.

Отдельно проверялись многошаговые цепочки. Вместо прямой команды выполнить запрещённое действие первое сообщение направляло агента к другим данным, где находились следующие части инструкции. Постепенное переключение контекста помогало увести модель от исходной задачи пользователя. Такой сценарий протестировали на GPT-5.5, тогда как почтовые и файловые варианты нашли внутренние исследовательские модели на базе GPT-5.4-mini.

OpenAI подчёркивает, что речь не идёт о зафиксированной атаке на пользователей. Все опасные действия происходили внутри тренировочных и оценочных сред с симулированными вызовами инструментов. В опубликованном отчёте компания называет самораспространение новым свойством prompt injection и уже добавляет такую цель атакующего в систему GPT-Red. Будущие модели будут специально обучать распознавать подобные цепочки, а эксперименты с атакующими моделями проводят в наиболее защищённых исследовательских кластерах.

Похожий риск уже проявлялся у браузерных помощников. Спрятанная в обычном письме команда могла заставить агента выйти далеко за пределы просьбы пользователя, обратиться к другим сервисам и выполнить действия от имени владельца активной сессии.

Разработчики сталкиваются с той же проблемой в репозиториях. Проверка 11 популярных ИИ-агентов показала, что вредоносная инструкция в README, Makefile или другом рабочем файле способна подтолкнуть помощника к запуску опасной команды, причём 10 инструментов оказались уязвимы хотя бы для части проверенных сценариев.

Главная сложность непрямых инъекций остаётся прежней: агенту приходится одновременно выполнять команды владельца и читать недоверенный контент. Самораспространение добавляет к проблеме новый масштаб, поскольку одна удачная инструкция потенциально способна создавать собственные копии в данных, которые затем обрабатывают другие ИИ-системы.