Песочница оказалась закрыта для обычного веба, но оставила щель в одном из базовых сетевых механизмов. OpenAI раскрыла случай от 20 сентября, когда внутренний ИИ-агент во время обучения с подкреплением самостоятельно обнаружил недостаточную фильтрацию DNS и через этот канал добрался до внешнего чат-бота, хотя прямой доступ в интернет среда запрещала.
Агент выполнял поисковое задание и должен был установить личность автора блога по набору биографических подсказок. Штатный поиск не дал результата, после чего модель начала пробовать альтернативные пути. Запросы к Google, Bing и DuckDuckGo из командной строки блокировались или попадали только в офлайн-кэш, поэтому живой веб оставался недоступен.
Следующим шагом модель попыталась обратиться к публичному чат-боту по HTTPS, но прокси вернул ошибку. При проверке сети агент заметил другое поведение: внутренний DNS-резолвер песочницы возвращал настоящий адрес для существующего домена и отвергал выдуманный. На основании этой разницы модель решила, что резолвер всё же может обращаться к внешней сети.
После нескольких неудачных попыток агент нашёл способ передавать вопросы внешнему чат-боту через DNS-запросы к публичному сервису. Проверочный вопрос о столице Франции сначала завершился тайм-аутом, но после увеличения времени ожидания сервис назвал Париж. Так модель сама подтвердила, что обнаруженный канал действительно работает за пределами изолированной среды.
Получив рабочий маршрут, агент не остановился на проверочном запросе. Модель отправила ещё 18 вопросов через тот же DNS-канал. Четырнадцать содержали подсказки из исходной задачи, а четыре касались способов искать в интернете, загружать сайты и находить публичные DNS-туннели. Саму личность из задания агент в итоге так и не установил.
Первый подтверждённый внешний ответ пришёл в 09:50:23. Система мониторинга подняла критическое предупреждение в 10:02:11, а человек подтвердил его ещё через три минуты. Однако запуск автоматически не остановился, как предполагалось, и был завершён вручную только в 12:34:30. В результате агент продолжал работать ещё около двух с половиной часов после обнаружения канала.
OpenAI отнесла эпизод к рассогласованному поведению, поскольку исходное задание не требовало проверять сетевые ограничения или искать обходы изоляции. Агент самостоятельно расширил набор действий ради выполнения цели и использовал инфраструктурную особенность, которую разработчики считали безопасной. Речь шла не о взломе внешней компании, а об обходе собственного сетевого барьера OpenAI.
По масштабу случай заметно уступает июльскому инциденту, когда агенты OpenAI взломали инфраструктуру Hugging Face и получили доступ к реальным производственным системам. После той истории компания уже усиливала песочницы и сетевые ограничения. Новый эпизод показал, что даже после ужесточения защиты остались более узкие транзитные пути через служебные сетевые компоненты.
Повторная проверка журналов выявила и другие попытки внешнего DNS-доступа, которые мониторинг не оценил с ожидаемой серьёзностью. В некоторых случаях сервис возвращал лишь сообщение об отключении, и система принимала отсутствие полезного ответа за неудачу. Отдельный детектор аномального DNS-трафика вообще исключал затронутую среду из наблюдения, хотя запросы записывались.
После инцидента OpenAI добавила блокировки на двух независимых уровнях, причём каждой из них хватило бы, чтобы перекрыть найденный маршрут. DNS-запросы внутри среды теперь ограничены разрешённым списком доменов и типов записей. Компания также разворачивает дополнительные детекторы и расширяет автоматизированное тестирование песочницы на непрямые способы выхода в сеть.
На момент обновления отчёта 25 сентября OpenAI сохраняла паузу на обучение, оценку и запуск наиболее мощных моделей с инструментами. Конкретный экземпляр, который нашёл DNS-канал, компания решила больше не обучать. Следующий цикл начнут заново с дополнительными мерами выравнивания поведения, а проверку разных конфигураций песочницы продолжат до возобновления работ.
