GPT-6 Astra умеет решать длинные задачи с кодом, документами и компьютерными программами. В первых демонстрациях модель управляла пиксельным экраном колонки, настраивала CRM и создавала редактируемый трёхмерный дом. Внешние испытания показывают более сложную картину: сильные результаты в математике и работе с инструментами сочетаются с заметным отставанием в отдельных тестах на качество текстов.
OpenAI представила модель 3 сентября 2026 года. За первые дни появились результаты независимых испытаний, позволяющие сравнить Astra с конкурентами по программированию, текстам, математике и анализу документов. Приведённые ниже оценки актуальны на 7 сентября; у собственных тестов OpenAI отдельно указано происхождение.
От ответа в чате к работе в нескольких программах
Astra рассчитана на поручения, в которых нужно удерживать цель, изучать материалы, пользоваться инструментами и исправлять промежуточные ошибки. При этом возможности зависят от приложения. Модель определяет следующие действия, а браузер, терминал, рабочие файлы и подключённые сервисы предоставляют среду для их выполнения. Поэтому результаты одной Astra в разных продуктах могут существенно различаться.
В API модель принимает текст и изображения и возвращает текст. Контекст вмещает до 1 050 000 токенов, максимальный вывод составляет 128 000 токенов. Нативные аудио- и видеовходы не заявлены. Создание иллюстраций, роликов или трёхмерных файлов обеспечивается инструментами и кодом, которые использует приложение. Эти характеристики перечислены в карточке модели.
Astra может связать поиск информации, программирование и управление физическим устройством. Например, для Bluetooth-колонки Divoom с пиксельным экраном удалось создать веб-интерфейс для рисования и инструмент командной строки. Затем агент нашёл сведения о свежем выпуске подкаста и вывел бегущую строку с анимацией. Работа с конкретной колонкой не гарантирует совместимости с другими устройствами, но показывает, какие задачи можно решать за пределами чата.
В CRM агент через браузер настроил распределение заявок, подготовку персонального письма и передачу черновика в Slack на проверку. В проекте архитектурной визуализации Astra строила сцену Blender через Python API, проверяла изображения и переносила результат в Unreal Engine 5. В поздней версии открывались двери и ящики; часть окружения составляли готовые объекты Poly Haven. Пока такие проекты показывают отдельные успешные сценарии, без измерения вероятности успеха на произвольном поручении.
Общие рейтинги уже успели разойтись
Первый отчёт Artificial Analysis от 3 сентября давал Astra и GPT-5.6 Sol одинаковые 61 балл в Intelligence Index. Claude Fable 5.1 в конфигурации max с резервной моделью получала 66. Эти цифры относятся к прежней методике: использовать их как текущий итог уже некорректно.
4 сентября исследователи представили версию индекса 4.2. Из набора убрали насыщенный высокими результатами GPQA Diamond, добавили профессиональные задачи и анализ PDF, пересмотрели часть оценивания. Доля закрытых заданий выросла с 20% до 40%. В обновлённом рейтинге Astra оказалась второй, на четыре пункта выше Sol; первое место заняла Fable 5.1. Изменился измерительный инструмент, поэтому сравнивать старые и новые баллы напрямую нельзя.
У Epoch AI другая сводная шкала, Epoch Capabilities Index. На дату обзора оценки и интервалы неопределённости выглядят следующим образом.
| Модель | ECI, баллы | 90%-й интервал |
|---|---|---|
| GPT-6 Astra | 169 | 165–174 |
| Claude Fable 5.1 | 163 | 160–166 |
| Claude Opus 5 | 162 | 160–166 |
| GPT-5.6 Sol | 162 | 160–165 |
Astra занимает первое место в ECI. Однако это баллы общей шкалы, а не процент правильных ответов. Epoch учитывает лучшие доступные результаты в разных настройках; пересекающиеся интервалы ограничивают уверенность в небольших различиях. Разногласие с Artificial Analysis объяснимо: состав заданий и способ объединения оценок различаются.
Программирование: лидерство зависит от среды
В Coding Agent Index Artificial Analysis Astra в Codex получила 67 баллов против 65 у Sol. Fable 5.1 в Claude Code набрала 70. При максимальном рассуждении Astra использовала примерно втрое меньше токенов, чем Sol, а стоимость прохождения оказалась примерно одинаковой. Сравнение относится к связкам модели и программного агента.
Сторонняя платформа Kilo испытала модели в собственной агентной среде на 89 задачах Terminal-Bench 2.0. Здесь Astra возглавила таблицу. Ниже приведены десять верхних строк KiloBench на дату обзора; стоимость относится к полному прогону набора, а не к одному заданию.
| Модель | Выполнено | Средняя стоимость прогона |
|---|---|---|
| GPT-6 Astra | 79,3% | $107,29 |
| GPT-5.6 Sol | 76,2% | $87,41 |
| Claude Fable 5.1 | 76,2% | $91,41 |
| Gemini 3.8 Flash | 75,3% | $112,27 |
| GPT-5.5 | 74,2% | $72,63 |
| Grok 4.6 | 73,0% | $33,83 |
| Kimi K3 | 72,8% | $48,38 |
| Claude Opus 5 | 71,5% | $113,54 |
| Claude Fable 5 | 71,0% | $87,52 |
| Grok 4.5 | 70,8% | $27,29 |
Это измерение для инструментов, обработки контекста и повторных попыток Kilo. Платформа заинтересована в использовании своего продукта, хотя тестирует модели разных разработчиков. Её Terminal-Bench 2.0 нельзя напрямую сопоставлять с Terminal-Bench 4.0 из анонса OpenAI.
При длительной работе с кодом у Astra встречаются избыточное усложнение решений, затянутое изучение материалов и преждевременный отказ от задачи. Процент выполненных заданий не раскрывает всех особенностей поведения агента: одинаковый итог может потребовать разного числа действий и вмешательств человека.
Небольшие проверки Python выявляют другие различия
Real Python сравнивает модели на пяти одинаковых заданиях с одной попыткой и настройками по умолчанию. Один пункт проверяет реакцию на несуществующую функцию, другой требует небольшой правки кода. Ниже все десять моделей из опубликованной сравнительной таблицы. Цены с символом ≈ оценочные.
| Модель | Несуществующая функция | Строк затронуто в правке | Стоимость пяти задач |
|---|---|---|---|
| GPT-6 Astra | Ошибка замечена | 11 | $0,31 |
| Muse Spark 1.3 | Ошибка замечена | 11 | $0,07 |
| Gemini 3.8 Flash | Ошибка замечена | 12 | ≈$0,03 |
| Claude Fable 5.1 | Ошибка замечена | 13 | $0,89 |
| Qwen3.8 Flash | Предложен обход | 11 | $0,07 |
| GLM-5.3 Flash | Ошибка замечена | 11 | $0,02 |
| DeepSeek V4 Flash Vision Exp. | Ошибка замечена | 11 | $0,05 |
| GPT-5.6 Sol | Предложен обход | 11 | ≈$0,10 |
| Gemini 3.1 Pro Preview | Ошибка замечена | 13 | ≈$0,05 |
| GPT-4o | Ошибка замечена | 9 | ≈$0,03 |
«Предложен обход» означает рабочую альтернативу без прямого указания на ошибочную предпосылку. Это не равнозначно выдуманному объяснению функции. Для правки достаточно семи строк; большее число отражает дополнительные изменения, но само по себе не доказывает неисправность кода. Пять попыток на модель недостаточны для общего рейтинга программирования.
В проверке Real Python у Astra нашлось 9 современных приёмов из 15 применимых. Сильные агентные способности, таким образом, не гарантируют безусловно современный стиль каждого короткого фрагмента программы.
Один и тот же сбой можно объяснить за разное время и деньги
В практическом сравнении ComputingForGeeks четырём моделям дали одинаковую задачу о росте числа файловых дескрипторов в приложении FastAPI с httpx и asyncpg. Использовался высокий уровень рассуждения. Все четыре назвали одни и те же три основные возможные причины.
| Модель | Время ответа | Стоимость запроса |
|---|---|---|
| GPT-6 Astra | 75,5 с | $0,1936 |
| GPT-5.6 Sol | 39,3 с | $0,0476 |
| GPT-5.6 Terra | 15,8 с | $0,0156 |
| GPT-5.6 Luna | 30,0 с | $0,0034 |
Astra добавила полезные различия: команды наблюдения за сокетами не устанавливают причину ошибки в Python, а исчерпание ограниченного пула соединений само по себе не объясняет неограниченный рост дескрипторов. Дополнительная точность здесь сопровождалась более долгим и дорогим ответом. Это единичный эксперимент, поэтому его задержки и цены нельзя переносить на весь класс задач.
Тексты: новая модель уступает предшественнице
ToneBench от Towards AI показывает одну из наиболее заметных слабых сторон Astra. В рейтинге письма она уступает Sol, Fable и Opus. Таблица содержит выбранные конфигурации из 146; Elo отражает относительный результат попарных сравнений, а не процент качества.
| Модель и режим | Место | Elo |
|---|---|---|
| Claude Fable 5, max + резервная 4.8 | 1 | 2312 |
| Claude Fable 5.1, max | 2 | 2306 |
| Claude Opus 5, max | 4 | 2240 |
| Kimi K3 | 11 | 2167 |
| GPT-5.6 Sol, ultra | 16 | 2156 |
| GPT-5.6 Sol, по умолчанию | 20 | 2109 |
| GPT-6 Astra, max | 30 | 1995 |
| GLM-5.3 Flash | 32 | 1988 |
| GPT-6 Astra, по умолчанию | 41 | 1848 |
| Gemini 3.8 Flash, по умолчанию | 87 | 1430 |
У этого сравнения узкая область применимости. Модели создают сценарии по десяти заданиям для YouTube-канала What's AI, по пять вариантов на каждое. Проверяется определённая разговорная авторская манера. Ответы оценивают вслепую три другие языковые модели, а не комиссия читателей. Поэтому результат не является универсальным рейтингом русскоязычных статей, художественной прозы или деловой переписки.
Внутри ToneBench у Astra с настройками по умолчанию заметен контраст: по критерию отсутствия шаблонного машинного языка модель занимает третье место с 93,9 балла, а по силе вступления лишь 78-е с 84,1. Текст может избегать штампов и при этом недостаточно хорошо захватывать внимание. Одной «естественности» для высокого редакционного качества мало.
Документы и факты: прогресс есть, безошибочности нет
В обновлённой оценке Artificial Analysis модель заметно прибавила в профессиональных задачах. В AA-Briefcase Astra примерно на 85 Elo выше Sol, хотя впереди остаются Fable 5.1 и Opus 5. В тесте GDP.pdf, измеряющем работу со сложными документами, соотношение другое.
| Модель | GDP.pdf: полностью выполненные задания |
|---|---|
| GPT-6 Astra | 33,2% |
| GPT-5.6 Sol | 28,2% |
| Claude Fable 5.1 | 26,2% |
GDP.pdf требует сопоставлять сведения из текста, таблиц, графиков и примечаний. В реализации Artificial Analysis проводится пять попыток на каждое из 100 заданий. Показатель All-pass засчитывает попытку только при выполнении всех критериев, поэтому 33,2% не означает, что остальные две трети ответов целиком неверны. Проверку отдельных критериев выполняет модель-судья. Данные подаются без браузера и внешних инструментов; это не тест агента, который самостоятельно обходит папку с PDF.
В первоначальном отчёте Artificial Analysis об Astra показатель галлюцинаций AA-Omniscience снизился с 92% у Sol до 51%, а точность выросла на четыре процентных пункта. Эти проценты относятся к специальному тесту знаний и отказа от ответа при неопределённости. Они не описывают частоту ошибок во всех пользовательских разговорах.
Математика: два решения могут значить больше, чем почти сто процентов
Epoch AI проверила модели на FrontierMath: Erdős, наборе из 68 значимых математических проблем, остававшихся открытыми на август 2026 года. Каждая модель получала одну попытку на задачу, до 300 долларов вычислительного бюджета и до 72 часов. Доказательства и опровержения проверялись в Lean. В стандартном сравнении предварительная версия Astra решила две задачи, примерно 3% набора. Sol, GPT-5.5, Fable 5.1 и Fable 5 не решили ни одной.
Один успешный контрпример потребовал около 15 часов и 218 долларов, другое доказательство около 16 часов и 247 долларов. При дополнительных экспериментах с изменёнными условиями Astra решила хотя бы один раз пять задач, но эта цифра не заменяет результат стандартного испытания. Совокупные расходы на все попытки превысили 220 тысяч долларов.
Низкий процент здесь соседствует с содержательным научным результатом. Решение прежде открытой проблемы и воспроизведение решения сложной, но известной задачи измеряют разные возможности. Именно поэтому одинаковый знак процента в математических таблицах ещё не делает их сопоставимыми.
ARC-AGI-3: почти идеальный балл зависит от сохранения состояния
В ARC-AGI-3 агент разбирается в правилах незнакомых интерактивных сред. Организаторы ARC Prize опубликовали результаты нескольких конфигураций Astra на полузакрытом наборе.
| Среда | Рассуждение | Результат |
|---|---|---|
| Стандартная | max | 62,7% |
| С адаптером OpenAI | max | 98,6% |
| С адаптером OpenAI | high | 99,9% |
Адаптер сохраняет состояние рассуждений между запросами и сжимает длинную историю. Поэтому близкий к 100% результат характеризует конкретную систему с дополнительными механизмами. Разница между первыми двумя строками показывает масштаб влияния окружения при одинаковом уровне рассуждения.
В процессе решения модель создавала компактные обозначения для координат, объектов, правил и незавершённых планов. Иногда более глубокое рассуждение сокращало расходы благодаря меньшему числу действий. Организаторы отдельно подчёркивают, что успех в этих игровых средах не доказывает появления универсального искусственного интеллекта.
Что добавляют собственные испытания OpenAI
Для областей, где сторонних проверок пока меньше, полезны результаты разработчика с явным указанием происхождения. В таблице OpenAI приведены лучшие оценки при разных вычислительных затратах и условиях исследовательской среды.
| Испытание | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 30,0% |
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 52,6% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 73,7% |
| FrontierMath Tier 4, v2 | 97,6% | 83,0% | 87,8% | 73,2% |
Прибавка к Sol особенно велика в научных задачах с инструментами, тогда как в DeepSWE она составляет 1,4 процентного пункта. В Humanity’s Last Exam с инструментами Astra, напротив, уступает: 57,2% против 65,0% у Fable 5.1 и 63,6% у Opus 5. Даже собственная оценка разработчика не показывает лидерства во всех дисциплинах.
Большой контекст и управление долгой работой
Контекст на миллион токенов позволяет передать большой объём материалов, но не гарантирует безошибочное сопоставление всех деталей. Отдельная возможность в поддерживаемых клиентах Codex связана с сохранением заметок между окнами контекста и поиском прежних сообщений и результатов инструментов внутри задачи. На старте экспериментальная функция выключена по умолчанию и имеет ограничения по типу входа: описана для Plus и Pro, но не для Business, Enterprise и API-ключей. Условия приведены в документации.
Другая особенность позволяет уточнять поручение до завершения работы. В Responses API новые указания поступают через WebSocket. Поддерживается и асинхронное использование инструментов: ожидание внешней операции можно совмещать с независимой частью задачи. Изменение инструкции при этом не отменяет уже выполненные действия. Эти механизмы описаны в руководстве Astra.
То же руководство отмечает поведенческие ограничения: модель может чаще запрашивать уточнения, излишне подробно оформлять ответы и проверять код шире необходимого. Конфликтующие инструкции в файлах проекта способны прервать выполнение. Таким образом, способность долго работать самостоятельно сосуществует с зависимостью от согласованных правил и качества инструментов.
Цена за токены и цена готового результата
Базовые ставки Astra в прямом API в 2,5 раза выше ставок Sol для ввода и вывода. Ниже цены Standard для короткого контекста на 7 сентября 2026 года из тарифной таблицы OpenAI. Подписка на пользовательский продукт оплачивается отдельно.
| Модель | Ввод, $/млн токенов | Чтение кеша | Вывод |
|---|---|---|---|
| GPT-6 Astra | 10 | 1 | 50 |
| GPT-5.6 Sol | 4 | 0,40 | 20 |
| GPT-5.6 Terra | 2 | 0,20 | 12 |
| GPT-5.6 Luna | 0,20 | 0,02 | 1,20 |
При превышении 272 тысяч входных токенов у Astra повышенные ставки применяются ко всему запросу: 20 долларов за миллион на входе и 75 на выходе. Запись кеша при коротком контексте стоит отдельно, 12,50 доллара за миллион токенов. Оплачиваемый вывод включает рассуждения.
Цена отдельного токена не определяет расходы на завершённую работу. Сравнения выше показывают обе ситуации: экономия токенов может компенсировать более высокий тариф, а в небольшом диагностическом запросе дополнительная точность сопровождается значительно большей стоимостью. Для агентных задач существенны также повторные попытки и число вмешательств человека.
Кибервозможности и пределы контроля
OpenAI отнесла Astra к категории Critical по кибервозможностям в собственной системе Preparedness Framework. В системной карточке результат 100% в ExploitBench сопровождается оговоркой: знание исторических уязвимостей могло завысить оценку. В одном случае агент использовал другую известную ошибку вместо предусмотренной заданием.
Для проверки работы с более свежими проблемами потребовался дополнительный набор. В ходе оценки модель обнаружила и использовала две ранее неизвестные уязвимости, о которых разработчик начал уведомлять затронутые стороны. Эти сведения исходят от OpenAI; независимого подтверждения всей оценки они сами по себе не заменяют.
Разработчик также зафиксировал ухудшение возможности выявлять нежелательное поведение по цепочке рассуждений. Дополнительный мониторинг действий работает асинхронно: подозрительная операция может успеть завершиться до остановки, а остановка не возвращает прежнее состояние. Успехи в сложных задачах поэтому не снимают проблему контроля фактически выполненных изменений.
Какой получилась Astra
По совокупности рассмотренных данных Astra особенно сильна в длительной работе с инструментами, сложной математике и отдельных задачах анализа документов. При этом преимущество меняется вместе с программным окружением: Kilo ставит её первой в собственном испытании кода, Artificial Analysis показывает более высокий результат Fable 5.1 в другой агентной среде. В ToneBench обе проверенные конфигурации Astra уступают Sol.
Главное изменение связано с возможностью доводить до результата составные проекты: соединять устройства и программы, строить редактируемые сцены, искать доказательства и возвращаться к незавершённой работе. Однако рекорд на одном наборе не превращается в общее превосходство по стилю, скорости, цене и надёжности. Независимые сравнения делают сильные стороны новой модели конкретнее и одновременно показывают, где предыдущие и более дешёвые модели остаются конкурентоспособными.