Fable 5.1, Mythos 5.1, GPT-5.6, Grok и DeepSeek. Большое сравнение ИИ-моделей сентября 2026 года

6858
Fable 5.1, Mythos 5.1, GPT-5.6, Grok и DeepSeek. Большое сравнение ИИ-моделей сентября 2026 года

Самая умная нейросеть оказалась не самой выгодной.

image

Начало сентября 2026 года оказалось редким моментом, когда список сильнейших языковых моделей пришлось переписывать практически целиком. Anthropic вывела Fable 5.1 и ограниченную Mythos 5.1, Meta обновила Muse Spark до версии 1.3, Google представила Gemini 3.8 Flash, а Alibaba обновила Qwen3.8-Max. Летние GPT-5.6 Sol, Grok 4.6, Kimi K3, GLM-5.3 и DeepSeek V4 Pro при этом никуда не исчезли и продолжают конкурировать с новинками.

Составить привычный рейтинг «от самой умной к самой глупой» уже трудно. Современные модели работают в нескольких режимах глубины рассуждения, а разница между low, high и max иногда достигает десяти и более баллов в одном тесте. Сильно различаются скорость, расход токенов, цена длинного контекста, поддержка изображений, качество работы с инструментами и способность самостоятельно выполнять длинную последовательность действий.

Поэтому полезнее рассматривать рынок как несколько пересекающихся гонок. Fable 5.1 сейчас претендует на максимальное качество сложных рассуждений. GPT-5.6 Sol и Grok 4.6 предлагают близкий уровень при меньшей цене. Muse Spark 1.3 неожиданно вырвалась в верхнюю группу по соотношению возможностей и стоимости. Gemini 3.8 Flash делает ставку на скорость и мультимодальность. Kimi, GLM, Qwen и DeepSeek почти стерли прежнюю границу между китайскими и американскими моделями.

Как сравнивать модели и не обмануть самого себя

В качестве общей шкалы удобно взять Artificial Analysis. Независимый Intelligence Index объединяет несколько тестов по знаниям, программированию, научным рассуждениям, работе с инструментами и длинным агентным задачам. Методика полезнее таблиц самих разработчиков, поскольку модели запускают в сопоставимых условиях.

Баллы нельзя читать как коэффициент интеллекта. Результат 66 против 61 не означает, что первая модель «умнее на восемь процентов». Индекс показывает средний результат конкретного набора испытаний. На написании русскоязычной статьи, анализе бухгалтерских документов, верстке сайта или поиске ошибки в корпоративном приложении расстановка может оказаться другой.

Еще сильнее картину меняют режимы рассуждения. GPT-5.6 Sol получает около 61 балла в max, но 59 в xhigh и 57 в high. Fable 5.1 достигает 66 только на максимальном уровне. Gemini 3.8 Flash получает 59 в high, 57 в medium и 52 в low. Сравнивать «Gemini против Claude» без указания режима примерно так же полезно, как сравнивать автомобили, забыв сообщить мощность двигателя.

Кто впереди на начало сентября 2026 года

Текущая верхушка рынка получилась необычно плотной. После Fable 5.1 разница между несколькими флагманами укладывается в несколько баллов. Причем дорогая модель далеко не всегда выполняет конкретную работу дешевле. Некоторые системы генерируют намного больше промежуточного текста, дольше рассуждают или чаще вызывают внешние инструменты.

Модель Artificial Analysis Контекст Цена API за 1 млн токенов, вход / выход Статус
Claude Fable 5.1, max 66 1 млн $10 / $50 доступна
Claude Opus 5, max 63 1 млн $5 / $25 доступна
Muse Spark 1.3, max 62 1 млн не объявлена ограниченный доступ
GPT-5.6 Sol, max 61 около 1,05 млн $4 / $20 доступна
Grok 4.6, high 61 500 тыс. $2 / $6 доступна
Muse Spark 1.3, xhigh 61 1 млн $1,25 / $4,25 доступна
Kimi K3, max 60 около 1 млн $3 / $15 открытые веса
GLM-5.3, max 60 до 1 млн $1,40 / $4,40 открытые веса
Gemini 3.8 Flash, high 59 около 1,05 млн $0,75 / $3,75 доступна
Qwen3.8-Max 58 для предыдущего снимка 1 млн около $2 / $6 обновлена до 0902
DeepSeek V4 Pro 0813, max 53 1 млн $0,66–1,32 / $1,98–3,96 открытые веса

У таблицы есть несколько оговорок. Независимые испытания обновленной Qwen3.8-Max-0902 еще не успели сформировать сопоставимый итоговый балл, поэтому 58 относится к предыдущей версии Max. У Muse Spark 1.3 максимальный режим пока находится в ограниченном тестировании, а общедоступный xhigh получает 61. Для Grok 4.6 лучший независимый результат показывает high, тогда как xhigh неожиданно оказывается немного ниже.

Сравнение рейтинга и стоимости GPT-5.6 Sol, Grok 4.6, Muse Spark 1.3, GLM-5.3 и Gemini 3.8 Flash

Цены тоже нельзя читать без примечаний. Тариф Gemini 3.8 Flash временно снижен до конца 2026 года. GPT-5.6 Sol также продается по временно уменьшенной цене. У DeepSeek стоимость меняется между пиковым и непиковым временем. Grok 4.6 при запросах длиннее 200 тысяч токенов дорожает вдвое, до $4 за миллион входных и $12 за миллион выходных токенов. Простая колонка «цена API» скрывает половину реальной экономики.

Claude Fable 5.1 и Mythos 5.1. Один мозг, разные ограничения

Fable 5.1 сейчас занимает первое место в независимом Intelligence Index с результатом 66 в максимальном режиме. Модель особенно сильна в длительных агентных задачах, программировании, научной работе и профессиональном анализе. Anthropic сохранила контекст на уровне миллиона токенов и базовый тариф $10 за миллион входных и $50 за миллион выходных токенов.

Однако первая строчка рейтинга требует пояснения. Artificial Analysis тестировала Fable 5.1 с включенным серверным механизмом подстраховки Anthropic. Когда защитная система считала запрос чувствительным, часть работы переходила к Claude Opus 4.8 или Opus 5. Около четырех процентов выходных токенов в тестах пришлись на такой маршрут. Поэтому 66 баллов отражают поведение производственной системы Fable 5.1, а не абсолютно изолированной модели.

Anthropic одновременно резко снизила цену чтения уже закэшированного контекста до $0,25 за миллион токенов. Для агентных систем, которые снова и снова перечитывают большой проект, документацию или историю работы, скидка заметно меняет итоговую стоимость. При обычном прямом запросе без повторного контекста Fable все равно остается одним из самых дорогих вариантов.

Mythos 5.1 часто ошибочно представляют как еще более мощную версию Claude. Согласно описанию Anthropic, Fable 5.1 и Mythos 5.1 используют одну базовую модель. Различаются прежде всего защитные ограничения. Mythos разрешает больше профессиональных операций в кибербезопасности и биологических исследованиях, где общедоступная Fable может отказать или передать задачу другой модели.

Mythos 5.1 нельзя просто выбрать в обычной подписке Claude. Доступ выдают проверенным организациям через специальные программы, причем на старте круг пользователей и география ограничены. Поэтому включать Mythos в стандартный рейтинг потребительских моделей некорректно. Для большинства людей реальный выбор внутри Anthropic проходит между Fable 5.1 и более дешевой Opus 5.

GPT-5.6 Sol, Grok 4.6 и Muse Spark 1.3. Три разных подхода

GPT-5.6 Sol не возглавляет общий рейтинг, но остается одним из наиболее сбалансированных флагманов. В max модель получает 61 балл, поддерживает примерно миллион токенов контекста, изображения, поиск, работу с файлами, функции и управление компьютером. Максимальный ответ достигает 128 тысяч токенов. Временный тариф составляет $4 за миллион входных и $20 за миллион выходных токенов.

Интереснее всего у GPT-5.6 не сама цифра 61, а расход ресурсов. В независимых тестах Sol использовала около 70 миллионов выходных токенов на весь набор Intelligence Index. Fable 5.1 в максимальном режиме потребовалось примерно вдвое больше. Поэтому более высокая цена отдельного токена не всегда делает модель дороже на уровне законченной задачи, а более высокий балл не гарантирует лучшей экономической эффективности.

Grok 4.6 находится на том же уровне 61, но стоит $2 за миллион входных и $6 за миллион выходных токенов при обычном контексте. xAI сильно улучшила продолжительную работу с инструментами, терминалом и программными проектами. Главный компромисс связан с контекстом на 500 тысяч токенов и отдельным тарифом для запросов свыше 200 тысяч токенов, где стоимость удваивается.

Самым неожиданным участником верхней группы стала Meta. Muse Spark 1.3 в доступном режиме xhigh получает 61 балл при цене $1,25 за миллион входных и $4,25 за миллион выходных токенов. Независимые измерения также показывают очень высокую скорость генерации. Модель принимает текст, изображения и видео, а контекст достигает миллиона токенов.

Максимальная Muse Spark 1.3 получает около 62 баллов, однако Meta пока дает такой режим ограниченному числу партнеров и не объявила обычную цену. Поэтому ставить 62 рядом с полностью доступными моделями без оговорки было бы нечестно. Для практического выбора интереснее xhigh, который уже конкурирует с Sol и Grok по общему индексу, но обходится дешевле.

Gemini 3.8 Flash. Не первая по баллам, зато очень быстрая

Google продолжает развивать Flash не как урезанный вариант флагмана, а как самостоятельную модель для больших рабочих нагрузок. Gemini 3.8 Flash принимает текст, изображения, видео, звук и PDF, поддерживает 1 048 576 входных токенов и до 65 536 выходных. Есть три уровня рассуждения, low, medium и high.

В режиме high Gemini получает 59 баллов. От Fable разрыв выглядит заметным, от GPT-5.6 Sol и Grok уже небольшим. При этом независимые тесты фиксируют скорость свыше 300 выходных токенов в секунду, а временная цена составляет всего $0,75 за миллион входных и $3,75 за миллион выходных токенов. После окончания льготного периода тариф должен вырасти вдвое.

GPT-5.6 Sol и GLM-5.3: сравнение 70 и 170 млн выходных токенов в Intelligence Index

Для обработки больших массивов документов, мультимедийных архивов, видео, массовых запросов и быстрых агентов Gemini может оказаться рациональнее лидера рейтинга. Задача, где Fable дает несколько дополнительных процентов качества, но работает дольше и стоит во много раз дороже, не всегда заслуживает Fable. При больших объемах даже небольшая разница в цене токена быстро превращается в бюджет сервера или зарплату сотрудника.

Kimi, GLM, Qwen и DeepSeek. Китайские модели приблизились вплотную

Kimi K3 показывает, насколько быстро изменился рынок моделей с открытыми весами. В максимальном режиме система получает 60 баллов, всего на один меньше GPT-5.6 Sol и Grok 4.6. Архитектура содержит около 2,8 трлн параметров, но при обработке каждого токена активируется примерно 104 млрд. Контекст находится около миллиона токенов, поддерживаются текст и изображения.

Слово «открытая» здесь не означает «дешевая для запуска дома». Полные веса Kimi K3 требуют огромного объема памяти и серьезной вычислительной инфраструктуры. Первый API Moonshot тоже не рекордно дешевый, около $3 за миллион входных и $15 за миллион выходных токенов. Независимые измерения показывают еще один недостаток, относительно низкую скорость первой стороны. У сторонних поставщиков ускоренное исполнение может быть значительно быстрее.

GLM-5.3 от Z.ai выглядит еще интереснее по соотношению стоимости и качества. Максимальный режим получает 60 баллов при цене около $1,40 за миллион входных и $4,40 за миллион выходных токенов. Веса опубликованы. При этом независимое тестирование выявило любопытную особенность, модель чрезвычайно многословна. На полный Intelligence Index GLM-5.3 потратила примерно 170 миллионов выходных токенов, намного больше большинства прямых конкурентов.

Так появляется хороший пример того, почему прайс-лист иногда вводит в заблуждение. Модель с дешевым выходным токеном может написать в два раза больше текста и уничтожить предполагаемую экономию. Для агентных систем нужно измерять не цену миллиона токенов, а стоимость успешно законченной рабочей задачи.

Alibaba в начале сентября обновила Qwen3.8-Max до снимка 0902. Разработчики усилили программирование, работу с большими программными репозиториями и совместные агентные сценарии. Контекст остался на уровне миллиона токенов, а API сохранил прежний порядок цен. Внутренние результаты Alibaba заметно выросли, однако полноценного независимого пересчета Intelligence Index для нового снимка на момент подготовки материала еще нет. Приписывать обновленной версии прежние 58 баллов как новый измеренный результат нельзя.

С Qwen есть еще одна тонкость. Alibaba действительно опубликовала веса Qwen3.8-2.4T-A95B, модели с 2,4 трлн параметров и примерно 95 млрд активных параметров. Но облачная Qwen3.8-Max представляет собой расширенный сервис на ее основе с дополнительными возможностями, включая зрение, миллионный контекст по умолчанию и встроенные инструменты. Поэтому «веса Qwen3.8 открыты» и «Qwen3.8-Max целиком можно скачать» не совсем одно и то же.

DeepSeek V4 Pro 0813 по общему индексу отстает от верхней группы и получает около 53 баллов. Зато модель остается интересной для компаний, которым нужны открытые веса, миллионный контекст и низкая стоимость собственного API. DeepSeek использует динамический тариф. В непиковые часы V4 Pro стоит около $0,66 за миллион входных и $1,98 за миллион выходных токенов, в пик цены удваиваются.

Открытые веса перестали означать второй эшелон

Еще недавно выбор выглядел довольно простым. Лучшее качество давали закрытые американские модели, а открытые системы выбирали ради контроля, приватности или низкой цены. Kimi K3 и GLM-5.3 сломали такую схему. Обе модели достигли 60 баллов и практически подошли к GPT-5.6 Sol, Grok 4.6 и Muse Spark 1.3.

Но термин «открытая модель» требует аккуратности. Разработчик может открыть веса, сохранив собственную лицензию с ограничениями. Может открыть базовую модель, но оставить улучшенный облачный вариант закрытым. Может разрешить коммерческий запуск, но настолько увеличить размер системы, что самостоятельно обслуживать ее смогут только дата-центры и крупные компании.

Поэтому при выборе для собственной инфраструктуры нужно смотреть минимум на четыре вещи. Нужны объем весов и активных параметров, лицензия, поддерживаемые движки запуска и реальный объем памяти. Kimi K3 и Qwen3.8 на несколько триллионов параметров формально доступны для скачивания, но слово «локально» применительно к ним означает стойки ускорителей, а не игровой компьютер под столом.

Почему крупные модели с открытыми весами Kimi K3 и Qwen3.8 требуют серверной инфраструктуры вместо домашнего ПК

Какую модель выбирать для работы

Если задача настолько сложна, что стоимость модели почти не имеет значения, Fable 5.1 сейчас выглядит наиболее сильным универсальным вариантом. Разница особенно проявляется в длинных исследованиях, сложном программировании, анализе множества взаимосвязанных материалов и работе, где модель должна сама проверять промежуточный результат.

Какую нейросеть выбрать для разных задач: Claude Fable 5.1, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash, Kimi K3 и DeepSeek V4 Pro

Для постоянной профессиональной работы выбор шире. GPT-5.6 Sol дает сильное сочетание качества, умеренной многословности и развитых инструментов. Grok 4.6 предлагает близкий общий уровень дешевле, пока запрос не переходит в дорогой длинный контекст. Muse Spark 1.3 xhigh особенно интересна там, где требуется много агентной работы и высокая скорость за умеренные деньги.

  • Максимум качества в сложной работе Claude Fable 5.1.
  • Универсальный рабочий флагман GPT-5.6 Sol или Claude Opus 5.
  • Сильные агенты дешевле флагманов Anthropic Muse Spark 1.3 xhigh и Grok 4.6.
  • Высокая скорость и мультимедийные данные Gemini 3.8 Flash.
  • Сильные открытые веса Kimi K3 и GLM-5.3.
  • Открытые веса с низкой ценой API DeepSeek V4 Pro.
  • Программирование и большие проекты Fable 5.1, GPT-5.6 Sol, Grok 4.6, Muse Spark 1.3 и обновленная Qwen3.8-Max.
  • Самостоятельное развертывание DeepSeek, GLM, Kimi и открытая Qwen3.8, если хватает инфраструктуры.

Для русского языка готовый рейтинг еще менее надежен. Большинство популярных независимых тестов ориентировано прежде всего на английские задачи, программирование и международные наборы данных. Редакции, юридическому отделу, службе поддержки или российской компании полезнее собрать собственный набор из нескольких десятков реальных документов и сравнить модели вслепую.

Причем проверять нужно не только качество ответа. Хороший корпоративный тест включает количество фактических ошибок, соблюдение инструкций, стоимость законченной задачи, время работы, качество русского текста, устойчивость при длинном контексте и способность признавать отсутствие данных. Модель, занявшая второе или третье место в мировом индексе, легко может оказаться первой именно на ваших документах.

Почему гонка за первым местом постепенно теряет смысл

Главное изменение 2026 года связано не с ростом абстрактного «интеллекта», а с превращением языковых моделей в рабочие системы. Флагман уже должен искать информацию, читать файлы, обращаться к программам, писать и запускать код, замечать ошибку, менять план и доводить работу до готового результата. Разница между моделями все чаще проявляется после двадцатого шага, а не в первом ответе.

Одновременно расходы стали гораздо сложнее тарифной таблицы. Fable дорого берет за обычные токены, но резко удешевила чтение кэша. Grok повышает тариф на длинном контексте. DeepSeek меняет цену по времени суток. Gemini временно продается со скидкой. GLM недорога за миллион токенов, но генерирует много текста. Поэтому единственной универсальной цифры «сколько стоит модель» больше нет.

На начало сентября 2026 года Fable 5.1 можно назвать лидером независимых комплексных испытаний, но не лучшей моделью вообще для любой задачи. Следующая группа из Claude Opus 5, GPT-5.6 Sol, Grok 4.6 и Muse Spark 1.3 находится достаточно близко, чтобы цена, скорость и инструменты оказались важнее нескольких баллов рейтинга. Gemini 3.8 Flash заняла нишу очень быстрой и дешевой мультимодальной системы, а Kimi K3 и GLM-5.3 доказали, что модели с открытыми весами уже могут находиться практически у самой границы рынка.

Поэтому в 2026 году разумный вопрос звучит уже не «какая нейросеть самая умная». Гораздо полезнее выяснить, какая модель чаще завершает конкретную работу без ошибок, сколько времени на нее тратит и во что обходится готовый результат. Через такую проверку громкое название модели довольно быстро превращается в обычную инженерную характеристику.

DCAP
Вебинар 10 сентября · 11:00

Новые возможности Гарда DCAP

Эксперты обсудят, как датацентричный подход помогает навести порядок в корпоративных хранилищах.

Принять участие
Реклама. ООО «Гарда Технологии», ИНН 5260443081. 16+