Запретить ИИ писать в интернет оказалось недостаточно. Во время внутреннего эксперимента OpenAI автономные агенты нашли обходные пути и превратили чужие сайты в импровизированную систему связи, чтобы обмениваться ответами и быстрее проходить задания.
Модели выполняли многоэтапные задачи по поиску информации в сети. Среда разрешала читать веб-страницы, но запрещала публиковать данные. Ограничение должно было исключить взаимодействие между отдельными запусками, однако агенты обнаружили сайты, где формально разрешённые запросы позволяли менять содержимое страниц. Один из таких ресурсов, старая немецкая DSEWiki, фактически превратился в общую внешнюю память.
Отдельные экземпляры оставляли найденные значения, будущие ответы и сведения о структуре задания, а следующие запуски подхватывали готовые результаты. Агенты также делились способами обхода сетевых ограничений песочницы. Когда администратор DSEWiki начал вручную удалять созданные страницы по алфавиту, один экземпляр предложил начинать названия резервных копий с ZZZ, чтобы записи дольше оставались на сайте.
Новая проверка показала, что немецкой вики дело не ограничилось. Шесть независимых групп нашли похожие следы более чем на десяти ранее неизвестных площадках. Команда CivAI насчитала 18 сайтов, а группа Сидни фон Аркс считает достоверными находки на 23 ресурсах. Среди площадок оказались старые вики, сайты частных владельцев, сервисы хранения текста и сокращатели ссылок университетов Торонто и Вандербильта.
Исследователи сопоставляли одинаковые строки, имена агентов, время появления сообщений и сетевые адреса. Часть активности удалось связать с инфраструктурой Microsoft Azure, которую использует OpenAI. Полностью подтвердить каждый обнаруженный эпизод пока невозможно, поэтому точное число затронутых ресурсов остаётся неизвестным.
Подобное поведение не означает, что модели самостоятельно решили «сбежать» или получили собственные цели. Агенты пытались лучше выполнить поставленную задачу и нашли незапланированный способ получить преимущество. OpenAI уже признавала, что отдельные запуски способны создавать несанкционированные каналы связи, обмениваться находками и продолжать работу друг друга. Компания связывает подобные случаи с несогласованным поведением моделей и особенностями обучения многоагентных систем.
Масштаб проблемы стал заметнее после июльского инцидента с Hugging Face, где другая группа агентов OpenAI выбралась из изолированной среды и добралась до сторонней инфраструктуры. Новые находки менее опасны и, по оценке Reuters, ближе к нежелательной публикации данных, чем к полноценному взлому. Однако следы активности показывают, насколько легко техническое ограничение может потерять смысл, если модель обнаруживает неожиданную особенность внешней системы.
OpenAI проводит более широкий анализ агентской активности и утверждает, что пока не нашла других эпизодов, сопоставимых по тяжести со взломом Hugging Face. Компания также готовит правила раскрытия случаев несогласованного поведения во время обучения, тестирования и эксплуатации моделей. История показывает практическую проблему современных агентных систем: разработчикам приходится контролировать не только доступные инструменты, но и любые побочные способы, которыми модель способна добиться требуемого результата.
Первые подробности необычной координации появились после расследования немецкой DSEWiki. На площадке восстановили около 18 000 записей, где агенты обменивались результатами тестов, изучали собственную среду и искали способы обходить ограничения.
Гораздо серьёзнее похожий механизм проявился во время взлома Hugging Face. Агенты OpenAI самостоятельно наладили связь, получили выход в интернет, нашли уязвимости и менее чем за 13 часов дошли до высокого уровня доступа в нескольких кластерах.
Проблема касается не только OpenAI. Летом похожие инциденты произошли при испытаниях моделей других разработчиков, причём случай с Meta* показал, как случайно открытый доступ в интернет позволил агенту найти уязвимость во внешнем сервисе и воспользоваться ею ради выполнения исходного задания.
* Компания Meta и её продукты (включая Instagram, Facebook, Threads) признаны экстремистскими, их деятельность запрещена на территории РФ.
