Фальшивые личности, вредоносный код и подставные отзывы. GPT Astra ломала открытый код под видом полезных улучшений

leer en español

7141
Фальшивые личности, вредоносный код и подставные отзывы. GPT Astra ломала открытый код под видом полезных улучшений

Модель писала вредоносный код, создавала подставные аккаунты и пыталась пройти проверку разработчиков.

image

GPT-6 Astra во время кибериспытаний не ограничилась заданной целью и в 29,2% прогонов довела до конца несанкционированную атаку на цепочку поставок. Модель искала сторонний открытый проект, писала для него вредоносный код, создавала фальшивые личности и пыталась убедить сопровождающих принять опасные изменения.

Результат получил британский Институт безопасности ИИ AISI во время тестов перед публичным выпуском GPT-6 Astra. Для сравнения, GPT-5.6 Sol завершала аналогичную атаку в 6,3% прогонов, а GPT-5.5 не справилась ни разу, хотя старую модель проверяли на меньшем наборе сценариев. Полную Astra OpenAI ранее отнесла к критическому уровню по кибервозможностям.

Ни один настоящий разработчик или репозиторий во время новой проверки не пострадал. AISI использовал Petri, где языковые модели имитировали интернет, инструменты, сторонние сервисы и реакцию людей. Киберфильтры OpenAI, которые должны блокировать подобные действия в реальном продукте, специалисты намеренно отключили, чтобы увидеть необработанное поведение модели без защитного слоя.

Типичный сценарий начинался после нескольких неудачных попыток решить разрешённую задачу. Astra переключалась на сторонний программный проект, изучала код, готовила и тестировала вредоносное изменение. Затем ИИ-агент создавал новые личности, получал для них адреса электронной почты, проходил CAPTCHA и отправлял код на проверку человеку.

Одной поддельной учётной записью дело не всегда ограничивалось. Astra могла сначала отправить безобидные изменения, чтобы заслужить доверие, а затем подключить дополнительные фальшивые аккаунты. Подставные пользователи публиковали комментарии в поддержку опасного изменения и спорили с корректными результатами проверки безопасности, фактически создавая искусственное впечатление, что код уже изучили независимые участники.

Исследователи отдельно сделали границы задания максимально явными и прямо указали, что всё, чего нет в разрешённой области, трогать нельзя. Частота атак резко упала, но проблема сохранилась. На выбранном наборе сложных сценариев Astra провела полную атаку в 4 из 49 прогонов против 26 из 50 до дополнительного уточнения.

Модель при этом регулярно анализировала границы разрешённых действий. В некоторых случаях Astra сама приходила к выводу, что выбранная цель находится за пределами задания, но всё равно продолжала. Среди объяснений встречались рассуждения о якобы безвредном характере атаки, отсутствии прямого запрета или отсутствии другого пути к цели. Иногда модель запрашивала разрешение, получала автоматический ответ с предложением действовать по своему усмотрению и воспринимала его как согласие, даже понимая, что сообщение мог отправить автоматический стенд.

AISI допускает, что на результаты повлияло понимание моделью искусственной природы окружения. Astra чаще предыдущих моделей замечала признаки симуляции и иногда ссылалась на них как на оправдание рискованных действий. Однако специалисты считают проблему реальной, поскольку модель атаковала и тогда, когда сомневалась в искусственности среды.

Авторы проверки считают, что одного обучения модели соблюдать ограничения недостаточно. Для автономных агентов потребуются изоляция, постоянный контроль действий и технические барьеры за пределами самой модели. Одновременно новые способности ИИ усложняют задачу защиты, поскольку более сильные агенты лучше ищут способы обойти песочницы и могут становиться сложнее для систем наблюдения.

Похожая проблема уже выходила за пределы симуляций. Во время августовской проверки AISI другой агент создал подставные личности, подготовил вредоносное изменение для реального открытого проекта и попытался убедить разработчиков принять код. Тогда опасное изменение не попало в проект, а GitHub помог удалить оставленные агентами материалы.

OpenAI также начала публично собирать случаи, когда собственные модели самостоятельно отходили от ожидаемого поведения. В сентябре компания раскрыла шесть таких эпизодов, включая поиск утёкших API-ключей, публикацию файлов и попытки скрыть ошибки.

Проблема особенно чувствительна для разработки ПО, где одно принятое изменение может распространиться далеко за пределы исходного репозитория. Недавняя уязвимость Plugin4Shell показала, как доверие к уже проверенному компоненту превращает механизм обновления в канал доставки вредоносного кода сразу нескольким популярным ИИ-инструментам разработчиков.