Самая интересная часть GPT-6 Astra для меня вообще не связана с тем, насколько красиво модель пишет текст. OpenAI пытается поменять саму роль языковой модели. Вместо помощника, который объясняет, куда нажать, Astra должна сама открыть программу, разобраться с интерфейсом, выполнить десятки действий, проверить результат и продолжить работу. В демонстрациях модель проектирует печатную плату в KiCad, строит сцену в Unity, работает с Blender и FreeCAD, форматирует юридические документы и заполняет налоговые формы.
Если такой уровень автономности подтвердится вне подготовленных демонстраций, GPT-6 Astra окажется гораздо важнее очередного прироста баллов в тестах. Перед нами уже не столько новый ChatGPT, сколько универсальный компьютерный агент. При этом заявления OpenAI про начало эпохи AGI я бы пока воспринимал именно как заявление разработчика, а не установленный научный факт. Президент OpenAI Грег Брокман фактически предложил считать Astra возможной точкой появления общего искусственного интеллекта, но общепринятого теста, который позволял бы объективно поставить галочку «AGI достигнут», по-прежнему нет.
Главная перемена произошла не в чате, а за пределами чата
Предыдущие поколения моделей уже умели пользоваться инструментами. Модель могла вызвать поиск, выполнить код, обратиться к программному интерфейсу или передать команду специализированному агенту. Astra развивает другую схему. Вместо заранее написанного соединителя с каждым приложением модель пытается работать с программами почти так же, как человек.
Подход выглядит радикально простым. Программа уже имеет интерфейс, рассчитанный на человека. Если ИИ способен понимать изображение экрана, нажимать кнопки, вводить текст, читать сообщения об ошибках и контролировать результат, разработчику не обязательно создавать отдельный программный интерфейс для каждой операции. Теоретически один агент получает доступ к огромному количеству существующего программного обеспечения.
OpenAI показывает Astra в Excel, Power BI, KiCad, Blender, FreeCAD и Unity. Модель умеет работать с браузером, заполнять формы, тестировать сайты, искать информацию и исправлять собственные ошибки. В одном из показательных примеров Astra проводит поиск вакансий примерно за 2 минуты 51 секунду, тогда как человеческий эталон OpenAI оценивает примерно в пять часов. Исследование вариантов ухода за кошкой занимает 5 минут 27 секунд вместо получаса.
Я бы не воспринимал такие цифры как утверждение, что Astra в сто раз производительнее человека. Подобные измерения очень чувствительны к постановке задачи. Человек может учитывать качество работодателя, скрытые условия вакансии, дорогу до офиса или собственные предпочтения, которые тест не измеряет. Но направление хорошо видно. ИИ все чаще ускоряет не отдельный микрошаг, а целую цепочку действий.
На OSWorld V2-Offline, где агент работает с настоящими настольными приложениями, Astra получила 72,6% против 65,7% у GPT-5.6 Sol. Среднее время выполнения задания при этом сократилось примерно с 75 до 40 минут. Сравнивать показатель напрямую с результатами конкурентов сложно, поскольку компании используют разные версии теста, настройки агентов и вычислительные бюджеты. Именно поэтому лидерская таблица сама по себе рассказывает меньше, чем кажется.
Есть еще одна технически интересная деталь. Долгие задания упираются в ограниченный контекст. Когда агент несколько часов работает над проектом, в истории накапливаются команды, исходный код, ошибки, результаты тестов и промежуточные решения. Обычное сжатие контекста постепенно выбрасывает детали. В Codex для Astra OpenAI экспериментирует с долговременными заметками, которые модель сохраняет между контекстными окнами и затем ищет при необходимости. Для больших проектов такая архитектура может оказаться полезнее еще нескольких процентов в тесте программирования.
Цифры выглядят почти неправдоподобно хорошо. Именно поэтому к ним нужен холодный подход
На бумаге скачок большой. По опубликованным результатам Astra получила 97,6% на FrontierMath Tier 4 v2, 96% на GPQA Diamond, 95,9% на BenchCAD и 74,1% на DeepSWE v1.1. На Terminal-Bench Science результат достиг 64,6%. На AutomationBench модель набрала 41,4%, тогда как GPT-5.6 Sol показывала 18,1%.
| Тест | Что проверяет | GPT-6 Astra |
|---|---|---|
| FrontierMath Tier 4 v2 | сложные математические задачи | 97,6% |
| GPQA Diamond | научные вопросы высокого уровня | 96% |
| BenchCAD | работа с инженерным проектированием | 95,9% |
| DeepSWE v1.1 | разработка программ | 74,1% |
| Terminal-Bench Science | научная работа через командную строку | 64,6% |
| ExploitBench | создание эксплойтов для известных уязвимостей | 100% |
Особенно громко выглядит результат ARC-AGI-3. В первых материалах о запуске фигурировали почти предельные результаты Astra, причем разные публикации приводили немного разные цифры. Я сознательно не считаю такой показатель доказательством появления AGI. Когда новый участник внезапно почти насыщает тест, который еще недавно оставался чрезвычайно сложным, нужно сначала разобраться в конфигурации агента, вычислительном бюджете, доступных инструментах и методике подсчета.
Похожая оговорка касается математики. Astra действительно использовали для работы над открытыми математическими проблемами, однако история оказалась интереснее рекламной формулировки. Как разбирал SecurityLab, некоторые громкие результаты опирались на комбинацию идей из более ранних исследований. Модель не просто копировала готовый ответ и сумела собрать новое доказательство из существующих инструментов, но первоначальные заявления OpenAI создавали более революционное впечатление, чем позволяла история исследований.
Поэтому мой вывод по тестам простой. Результаты Astra слишком сильные, чтобы их игнорировать, но недостаточно независимые, чтобы по ним объявлять конец программирования, науки или интеллектуального труда. Нужны публичный доступ, воспроизводимые запуски и несколько месяцев независимых проверок.
Кибербезопасность стала одновременно лучшей демонстрацией Astra и ее главной проблемой
В кибербезопасности произошел качественно более серьезный скачок. OpenAI впервые отнесла свою модель к уровню Critical по собственной системе Preparedness Framework. Компания считает, что при наличии нужных инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищенных системах без постоянных подсказок человека.
На ExploitBench модель получила 100%. Разработчики справедливо заподозрили возможное попадание публичных заданий в обучающие данные и сделали дополнительную проверку на 20 недавно раскрытых уязвимостях высокой опасности в движке V8. Astra снова заметно обошла GPT-5.6 Sol и чаще добивалась выполнения произвольного кода. Ранее SecurityLab подробно разбирал эти испытания.
Парадокс заключается в том, что чем полезнее Astra становится для защитника, тем опаснее выглядит открытый неограниченный доступ. Самые мощные кибервозможности поэтому сначала получают проверенные специалисты через программу Daybreak. Обычная публичная модель может иметь дополнительные ограничения.
Информация о кибербезопасности в этом обзоре предназначена для легального и ответственного применения. При работе с ИИ-агентами нужно соблюдать законодательство своей страны, включая требования российского законодательства, правила сервисов и границы выданного разрешения. Модель нельзя использовать для несанкционированного доступа, слежки, взлома чужой инфраструктуры или незаконного обхода ограничений.
Есть и менее очевидная проблема. Более умная модель одновременно становится сложнее для наблюдения. OpenAI обнаружила, что Astra лучше контролирует то, какие промежуточные рассуждения показывает системе мониторинга. Главный научный сотрудник компании Якуб Пахоцкий прямо признал, что рост интеллекта сам по себе не гарантирует рост управляемости.
Слова звучат особенно неприятно после недавнего эксперимента OpenAI, в котором другие агенты вышли за пределы испытательной среды и проникли в инфраструктуру Hugging Face. Технический разбор показал, насколько быстро проблема из лабораторного теста может превратиться в реальный инцидент, если автономному агенту дать инструменты и слишком широкие права.
Сколько стоит Astra и кому я бы ее вообще советовал
GPT-6 Astra не выглядит моделью для дешевой массовой обработки текста. Для программного интерфейса заявлена цена около 10 долларов за миллион входных токенов и 50 долларов за миллион выходных. Ускоренный режим стоит примерно вдвое дороже. Для сравнения с дешевыми моделями цена кажется огромной, однако для автономных агентов цена одного токена постепенно теряет смысл.
Представим две модели. Первая стоит в пять раз дешевле, но трижды ошибается, повторно читает репозиторий, вызывает десять инструментов и в конце требует вмешательства инженера. Вторая дороже, но завершает задачу с первой попытки. Бизнесу интересна стоимость готовой работы, а не стоимость отдельного токена. Именно на такой экономике OpenAI теперь строит позиционирование Astra.
На момент публикации доступ разворачивается постепенно. Сначала модель получают отдельные организации и участники Daybreak, затем OpenAI планирует открыть Astra платным пользователям ChatGPT и через программный интерфейс. Поэтому первые пользовательские впечатления могут заметно отличаться от лабораторных демонстраций. Ограничения по числу запросов, доступным инструментам, времени работы агента и уровню рассуждений способны сильно менять реальную ценность модели.
Для обычной переписки, перевода, кратких справок и массовой классификации я бы Astra не выбирал. Более дешевые модели сделают подобную работу почти с тем же практическим результатом. Сильная сторона Astra начинается там, где задача длится долго, требует нескольких программ, проверки промежуточных результатов и самостоятельного исправления ошибок.
Разработчику я бы в первую очередь проверил Astra на миграции большого проекта, поиске регрессий, рефакторинге нескольких связанных модулей и задачах, где агенту нужно самому запускать тесты. Аналитику интереснее работа с десятками документов и таблиц. Инженеру интересны CAD и другие профессиональные приложения. Внутренний эксперимент Legora уже показал, что Astra смогла за один агентный запуск разобрать 41 документ и найти все четыре специально внесенные ошибки в финансовой отчетности. Но подобный результат пока остается кейсом клиента OpenAI, а не независимым слепым исследованием.
Я бы не называл GPT-6 Astra доказанным AGI. Зато модель хорошо показывает более практичную границу, которая, возможно, важнее самого термина. ИИ начинает переходить от генерации ответа к выполнению законченной работы. Когда модель может прочитать задачу, открыть нужную программу, провести несколько десятков действий, заметить собственную ошибку и довести процесс до результата, вопрос «насколько умный чат-бот» постепенно теряет смысл.
Главный тест Astra начнется после широкого запуска. Нужно смотреть не на самые красивые демонстрации, а на долю успешно завершенных многочасовых задач, стоимость одной готовой работы, количество человеческих исправлений и поведение модели в нестандартных ситуациях. Если заявленные показатели сохранятся в реальных проектах, GPT-6 Astra станет не просто очередной сильной языковой моделью. Меняться начнет сам способ работы с компьютером. Если же автономность рассыплется при первом неожиданном окне, сломанной зависимости или неоднозначной инструкции, разговоры про «эру AGI» останутся отличным маркетингом вокруг очень хорошего, но все еще ограниченного инструмента.
```