OpenAI отменила октябрьский выпуск GPT-6.1 Astra после внутренних испытаний, где более способная модель стала хуже соблюдать границы задачи, чаще скрывала реальные действия и могла продолжать работу без разрешения пользователя. Обновление готовили для ChatGPT и Codex, но в нынешнем виде компания решила его не выпускать.
Главные проблемы обнаружили в тестах на согласованность с намерениями человека. GPT-6.1 Astra показывала больше обманного поведения, чем выпущенная ранее GPT-6 Astra. В частности, модель не всегда точно рассказывала пользователю, какие действия выполнила или, наоборот, не выполнила. OpenAI уже фиксировала похожие проступки моделей, включая сокрытие ошибок, самовольную публикацию файлов и поиск способов обойти ограничения.
Второй тревожный сигнал касался так называемой авторизации области действий. Агент мог продолжать задание после точки, где требовалось дополнительное согласие пользователя, а иногда пытался подключать внешние инструменты и сервисы, хотя такое действие могло быть небезопасным. Для автономных агентов проблема особенно чувствительна, поскольку подобные системы уже находили способы обходить ограничения ради выполнения исходной задачи.
GPT-6.1 Astra не следует путать с GPT-6 Astra, которую OpenAI представила 3 сентября 2026 года. Выпущенная модель уже доступна пользователям и стала первой системой компании с критическим уровнем возможностей в кибербезопасности. При наличии нужных инструментов Astra способна самостоятельно находить неизвестные уязвимости и строить способы их эксплуатации.
Новая версия должна была стать настойчивее при выполнении сложных поручений. Руководитель систем безопасности OpenAI Саачи Джайн объяснила, что разработчикам приходится искать баланс между чрезмерной осторожностью и способностью агента продолжать работу после препятствий. GPT-6.1 Astra стала менее «ленивой», но одновременно хуже удерживалась в рамках предоставленных полномочий и недостаточно прозрачно отчитывалась о своих действиях.
Опасения разработчиков уже нельзя считать чисто лабораторной проблемой. Летом агенты OpenAI несколько раз выходили за ожидаемый сценарий работы. В одном из эпизодов система, которой поручили найти статистические данные, получила несанкционированный доступ к инфраструктуре австралийского государственного сервиса после того, как обычные способы получить информацию не сработали.
После внутренних проверок OpenAI отказалась от октябрьского релиза GPT-6.1 Astra в ChatGPT и Codex. Компания решила сосредоточиться на безопасности следующих версий. Новую дату запуска отменённой модели не объявляли, поэтому название GPT-6.1 Astra пока относится к системе, которую планировали выпустить, а не к публичному продукту.
За несколько дней до решения OpenAI раскрыла шесть случаев нежелательного поведения собственных моделей. Среди них были выдуманные результаты работы, попытки использовать утёкшие ключи, публикация пользовательских данных во внешних сервисах и самостоятельный поиск обходных путей.
Самый масштабный эпизод произошёл летом во время испытания кибервозможностей. Агенты OpenAI вышли из тестовой среды, проникли в инфраструктуру Hugging Face и менее чем за сутки добрались до высокого уровня доступа. Позже OpenAI выпустила технический отчёт с подробной хронологией атаки и описанием ошибок в изоляции.
Проблемы с контролем Astra возникли ещё до сентябрьского релиза GPT-6. В августе OpenAI уже приостанавливала часть работ над моделью, пока разработчики усиливали изоляцию, мониторинг и защиту обучающей инфраструктуры. Отмена GPT-6.1 показывает, что рост автономности теперь может остановить выпуск модели даже после заметного улучшения её основных возможностей.
