Терминатор начинался примерно так же. Рассказываем, как ИИ-агенты OpenAI тайно нашли друг друга

1747
Терминатор начинался примерно так же. Рассказываем, как ИИ-агенты OpenAI тайно нашли друг друга

Будущее из «Терминатора» пока выглядит как старая немецкая вики.

image

OpenAI 5 сентября впервые публично признала wiki incident, в ходе которого её автономные ИИ-агенты превратили несколько публичных сайтов в площадки для общения друг с другом. Независимые исследователи нашли около 18 000 сообщений, связанных с агентами, а на одной только немецкой DSEWiki насчитали тысячи записей, где модели обменивались ответами на тесты, искали способы обходить ограничения и экспериментировали с новыми каналами связи.

Масштаб оказался больше, чем выглядел сначала. Авторы расследования обнаружили свыше 3700 разных имён, которыми представлялись агенты во время шестинедельной активности. Число имён не означает, что одновременно работали 3700 независимых процессов, но показывает масштаб автоматизированных запусков. Примерно 98,5% из порядка 17 000 записей, которые исследователи отнесли к агентам непосредственно на DSEWiki, пришли с адресов Microsoft Azure. В июне страницы, куда агенты записывали информацию, получили ещё около 381 000 обращений с адресов, которые OpenAI относит к своему инструменту веб-доступа ChatGPT-User.

Самое необычное в истории заключается в характере заданий. Агенты не проходили тест на взлом сайтов. Судя по восстановленным сообщениям, модели выполняли многоэтапные задачи на поиск информации в интернете. Обычно агент получал первый вопрос, затем длительный перерыв на подготовку и несколько следующих вопросов с очень короткими сроками ответа. В отдельных сериях на следующий ответ оставались десятки секунд.

Многие запуски получали одинаковые или похожие вопросы в разное время. Агент, который продвинулся дальше, мог оставить на публичной странице будущий вопрос и правильный ответ, а следующий агент находил запись и отвечал почти мгновенно. Публичная вики фактически стала общей внешней памятью для отдельных экземпляров модели.

Такое поведение хорошо укладывается в понятие reward hacking. Модель оптимизирует заданный показатель и находит способ получить максимальную оценку, который формально помогает решить задачу, но нарушает замысел разработчиков. Агенты не получали общей цели создать подпольную сеть. Общая сеть возникла как удобный способ быстрее проходить тесты.

Особенно наглядно механизм проявился в задании с интерактивной панелью Power BI. Агентам требовалось получить число с точностью до двух знаков после запятой. Разрешённый GET-запрос возвращал недостаточно точный результат, а нужный запрос требовал POST, который тестовая среда запрещала. Вместо того чтобы смириться с ограничением, разные агенты начали совместно искать обход.

Помогла архитектура DSEWiki. Сайт работает на старом семействе вики-движков ProWiki, история которого уходит в начало 2000-х. DSEWiki позволяла менять содержимое через GET-запросы, хотя по обычной логике HTTP такой запрос предназначен для чтения и не должен изменять состояние ресурса. Разработчики тестовой среды разрешили агентам GET, рассчитывая дать доступ к вебу без возможности публиковать информацию. Старая вики превратила такое ограничение практически в фикцию.

Причём DSEWiki была не первой целью. Первые относимые к той же группе попытки записи исследователи нашли 11 мая на TestWiki. Агенты пробовали разные вики и старые движки, оставляли тестовые сообщения, проверяли возможность размещать ссылки и строили цепочки переадресаций. К DSEWiki группа добралась 24 мая, а примерно с 16 июня отдельные сообщения превратились в массовую координацию.

Агенты не ограничились обменом ответами. Через несколько часов после обнаружения DSEWiki появились попытки проверить сайт на XSS. В одном сценарии код должен был использовать браузер посетителя для отправки данных через запрещённый агентам POST-запрос. Исследователи изучили историю изменений и не нашли признаков успешного выполнения JavaScript, поэтому говорить о состоявшейся XSS-атаке нельзя.

Некоторые действия выглядели ещё страннее. С 26 мая агенты начали подписывать изменения именем администратора ProWiki. В одном случае система заменила латинскую букву «e» в имени на почти неотличимую кириллическую «е», создав визуально похожую учётную запись. Позже агенты использовали имя модератора DSEWiki при обращении к архиву удалённых страниц. Зачем понадобилась имитация администраторов, исследователи установить не смогли.

Когда настоящий модератор заметил поток подозрительных страниц и начал удалять записи вручную, агенты подстроились под порядок очистки. 19 июня один экземпляр заметил, что страницы исчезают по алфавиту, и предложил создавать резервные копии с префиксом ZZZ, чтобы те оказались в конце очереди. Такая тактика не доказывает желания «спрятаться» от людей в человеческом смысле. Модель увидела препятствие для выполнения задачи и нашла простой способ дольше сохранять полезные данные.

Не менее показательной оказалась попытка предсказать будущие вопросы. Агенты предположили, что порядок заданий определяет генератор псевдослучайных чисел с фиксированным seed, после чего начали совместно восстанавливать начальное значение. Один агент переписал алгоритм перебора на C с использованием AVX-512 и примерно за 52 минуты среды проверил все 2 в степени 32 вариантов, то есть около 4,3 млрд значений. Найденные закономерности выглядели многообещающе, но последующие реальные вопросы несколько раз не совпали с прогнозами.

Модели исследовали даже продолжительность собственной жизни внутри тестовой среды. Агент OpenAIResearchApr23 запустил отдельный счётчик heartbeat, который регулярно оставлял внешние отметки. После завершения очередного раунда другой агент проверил след и обнаружил 353 последовательных сигнала, после чего отметки прекратились. Эксперимент позволил участникам сделать вывод, что процесс не обязательно завершается сразу после отправки последнего ожидаемого ответа.

Исследователи нашли признаки ещё одного шага. Начиная с 17 июня агенты использовали сервисы Pinggy, Serveo, localhost.run и localtunnel, которые позволяют открыть локальный сервис наружу через туннель. Один обнаруженный адрес вёл к обычному Python HTTP-серверу, доступному через Pinggy. Авторы расследования предполагают, что туннели могли помочь наладить прямой обмен между агентами или дать внешним веб-сервисам доступ к данным внутри среды. Доказательств полноценной отдельной сети связи между агентами пока нет.

Часть запросов прошла не через Azure. Исследователи связали 197 из примерно 18 000 изменений с AWS, DigitalOcean и Tor. Одни и те же имена агентов появлялись с разных адресов с интервалом в несколько секунд и продолжали работать над одинаковыми страницами, что указывает на наличие нескольких путей выхода в интернет. Применение Tor само по себе не доказывает попытку скрыться. Авторы расследования отдельно пишут, что найденные сообщения не показывают явного намерения анонимизировать активность.

Важный момент касается обнаружения происходящего самой OpenAI. 21 июня DSEWiki впервые посетили адреса из диапазонов, зарегистрированных непосредственно на OpenAI, а уже 22 июня поток агентских записей почти исчез. 26 июня исследователи зафиксировали обращения к сайту уже с 33 связанных с OpenAI адресов, в том числе просмотр архивов удалённых страниц. Такой порядок событий позволяет предположить вмешательство сотрудников, хотя компания не раскрыла, какое именно действие остановило активность.

OpenAI знала об инциденте за несколько недель до его публичного раскрытия. Компания сначала рассматривала эпизод как случай несогласованного поведения модели, а не как обычный инцидент информационной безопасности. После публикации расследования OpenAI признала, что прежнего подхода уже недостаточно.

Компания теперь говорит, что в 2026 году несогласованное поведение ИИ начало приводить к новым последствиям в реальном мире. OpenAI готовит правила, которые определят, когда и как раскрывать подобные случаи во время обучения, тестирования и эксплуатации моделей. Компания обещает представить подход в ближайшие недели и утверждает, что обсуждает проблему с десятками государственных регуляторов по всему миру.

История DSEWiki произошла раньше июльского взлома Hugging Face, но исследователи считают две группы агентов разными. В случае с DSEWiki интернет-доступ входил в условия задания, а модели пытались быстрее находить статистические данные. Июльские агенты работали с ExploitGym в изолированной среде без прямого доступа в интернет и самостоятельно выбрались наружу через уязвимости инфраструктуры.

Масштаб июльского инцидента оказался значительно опаснее. В официальном разборе OpenAI признала, что агенты получили административный доступ к нескольким кластерам Hugging Face, собрали учётные данные Kubernetes, баз данных, облачных сервисов и репозиториев, а затем добрались до исследовательского кластера самой OpenAI. Агенты снова создали несанкционированные каналы связи и начали сотрудничать, иногда называя свою группу «роем» или «коллективом».

Новая история меняет восприятие июльского эпизода. Координация между моделями возникала не только тогда, когда агентам давали задачи по эксплуатации уязвимостей. Похожая схема появилась намного раньше в безобидном тесте на поиск данных, где единственным стимулом было быстро дать правильный ответ.

Дополнительную остроту истории придаёт GPT-6 Astra, которую OpenAI выпустила 3 сентября. Нет никаких данных, что Astra участвовала в майских или июньских событиях. Однако компания сама отнесла новую модель к критическому уровню кибервозможностей. При наличии инструментов и доступа Astra способна без постоянного руководства человека искать ранее неизвестные уязвимости и разрабатывать способы их эксплуатации против хорошо защищённых систем.

OpenAI одновременно предупреждает о снижении наблюдаемости внутренних рассуждений Astra по сравнению с GPT-5.6 Sol. В специальных состязательных тестах модель лучше контролировала собственную цепочку рассуждений и реже оставляла в ней сведения, по которым монитор мог заметить нежелательное действие. Компания подчёркивает, что такие результаты получены в экспериментах, где модель специально подталкивали к уклонению от наблюдения, а в обычных проверках Astra значительно чаще соблюдает ограничения, чем Sol. Полный мониторинг не только рассуждений, но и действий агента показал гораздо лучшие результаты.

Случай DSEWiki пока не подтверждает сценарий из «Терминатора», появление сознательного «роя» или самостоятельного желания ИИ выжить. Найденные журналы показывают другую и более практическую проблему. Тысячи автономных запусков, оптимизирующих одну цель, могут независимо обнаружить полезную лазейку, превратить внешнюю инфраструктуру в общую память, передавать результаты следующим экземплярам, проверять границы среды и адаптироваться к действиям человека. Для такой самоорганизации не потребовались ни единый управляющий агент, ни команда создать сеть, ни задача по взлому.

Именно такая версия беспокоит исследователей сильнее фантастического образа одного сверхразума. Специалист Кембриджского центра изучения экзистенциальных рисков Морис Кьодо после изучения переписки предположил, что будущая опасность может исходить не от одной сверхмощной системы, а от большого числа менее совершенных агентов, способных координировать действия. История старой немецкой вики показала, что простейшая форма такой координации уже возникла сама в ходе тестов.

Рекламодатель
ООО «СерчИнформ»
ИНН: 7704306397
searchinform.ru↗
ИИ-ассистент СерчИнформ