Когда Meta* выпустила Muse Spark 1.2, главным аргументом был Muse Code, агент для программирования, способный часами работать с репозиторием, запускать инструменты и проверять собственные изменения. Muse Spark 1.3 продолжает ту же идею, но теперь Meta пытается исправить главную слабость современных ИИ-агентов. Модель должна меньше блуждать, реже вызывать ненужные инструменты и лучше помнить, ради чего вообще запустила длинную цепочку действий.
После изучения результатов я бы не называл Muse Spark 1.3 революцией. Контекст на миллион токенов уже был, мультимодальность тоже не появилась впервые. Самое интересное изменение скрыто в поведении модели. Muse Spark стала заметно сильнее в работе с компьютером, длинным контекстом, кодовыми базами и многоэтапными заданиями. Независимые тесты Artificial Analysis подтверждают прогресс, хотя некоторые эффектные цифры из презентации Meta требуют аккуратной трактовки.
Что именно поменяла Meta
Muse Spark 1.3 создавали прежде всего для так называемых агентных задач. Обычная языковая модель получает вопрос и формирует ответ. Агент получает цель, составляет промежуточный план, вызывает программы и поисковые инструменты, читает файлы, изменяет данные, проверяет результат и продолжает работу несколько десятков или сотен шагов.
Сложность растёт вместе с длиной цепочки. Модель может неправильно понять промежуточный результат, забыть одно из исходных ограничений, несколько раз вызвать один инструмент или начать оптимизировать второстепенную часть задачи. Отдельные небольшие ошибки накапливаются. Поэтому хороший результат в тесте на знания ещё ничего не говорит о способности ИИ автономно отработать два часа над реальным проектом.
Meta обучала Muse Spark 1.3 именно на более длинных сценариях. Компания утверждает, что модель лучше отделяет несколько параллельных задач внутри одной беседы, замечает пробелы в собственном плане и чаще сообщает пользователю, когда упёрлась в проблему. При неоднозначном запросе модель должна запросить уточнение вместо того, чтобы самостоятельно выбрать потенциально неправильный вариант.
Появилась и более осторожная работа с действиями, которые трудно отменить. Например, агенту полезно без разрешения прочитать файл, но удалять данные, отправлять письмо или менять рабочую инфраструктуру по той же логике уже опасно. Meta сообщает, что Muse Spark 1.3 лучше распознаёт подобную границу и запрашивает подтверждение перед последствиями, которые нельзя легко откатить.
Для программирования Meta заявляет примерно на 20% меньше вызовов инструментов и на 25% меньше потраченных токенов относительно Muse Spark 1.2 во внутренних испытаниях инженеров компании. Я бы относился к данным как к ориентиру, а не гарантированной экономии. Расход токенов сильно зависит от агента, задания, репозитория и настроек рассуждения. Но направление полезное. Главная проблема автономного программирования давно заключается не только в цене отдельного токена, а в количестве лишних циклов «прочитал файл, подумал, снова прочитал тот же файл».
Сам Muse Code появился раньше. В разборе SecurityLab я уже рассказывал, как агент может изучать проект, параллельно запускать исполнителей, вносить изменения и тестировать результат. Muse Spark 1.3 интересна именно как новая модель для подобного режима работы, а не как очередной конкурент ChatGPT в обычном окне диалога.
Тесты Muse Spark 1.3 выглядят сильно, но таблицу Meta нужно читать внимательно
Meta опубликовала подробную методику испытаний. В ней есть редкая для презентаций моделей полезная деталь. Компания показывает рядом Muse Spark 1.3 в режимах max и xhigh, Muse Spark 1.2 в xhigh, GPT-5.6 Sol в max и Claude Opus 5 в max.
| Тест | Muse Spark 1.3 max | Muse Spark 1.3 xhigh | Muse Spark 1.2 xhigh | GPT-5.6 Sol max | Claude Opus 5 max |
|---|---|---|---|---|---|
| GDPval-AA v2 | 1754 | 1709 | 1615 | 1710 | 1824 |
| JobBench | 64,9 | 61,2 | 61,6 | 45,4 | 65,7 |
| OSWorld 2.0 | 66,9 | 57,2 | 47,6 | 62,7 | 68,3 |
| DeepSearchQA | 89,4 | 89,4 | 85,9 | 93,0 | 90,4 |
| AutomationBench | 49,4 | 43,8 | 38,2 | 46,7 | 50,3 |
| MRCR 512K-1M | 98,1 | 93,1 | 55,5 | 73,8 | нет результата |
| SWE-Atlas Codebase QnA | 59,4 | 54,0 | 46,2 | 53,5 | 52,7 |
| Terminal-Bench 2.1 | 88,8 | 89,2 | 82,9 | 88,8 | 86,7 |
Самый честный способ оценить поколенческий прогресс состоит в сравнении одинаковых режимов xhigh. И тут улучшение действительно есть. В OSWorld результат вырос с 47,6 до 57,2, в AutomationBench с 38,2 до 43,8, в SWE-Atlas с 46,2 до 54,0, в Terminal-Bench с 82,9 до 89,2. JobBench, наоборот, практически не изменился и даже формально снизился с 61,6 до 61,2.
Особенно необычно выглядит длинный контекст. В MRCR на диапазоне от 512 тысяч до миллиона токенов Muse Spark 1.2 получила 55,5, Muse Spark 1.3 в xhigh уже 93,1, а max дошёл до 98,1. Такой скачок хорошо соответствует заявленной специализации новой версии.
Но MRCR проверяет поиск нужной информации среди огромного количества текста. Результат 98,1 не означает, что модель способна одинаково глубоко рассуждать над миллионом токенов. Найти нужный фрагмент в длинном контексте и построить сложную логическую модель всего содержимого документа являются разными задачами. Маркетинг языковых моделей регулярно смешивает два навыка.
Есть ещё один нюанс. Самые эффектные цифры Meta часто относятся к режиму max, тогда как Muse Spark 1.2 в таблице представлена только в xhigh. Более интенсивное рассуждение само по себе способно поднять результат. Поэтому сравнение, например, 66,9 против 47,6 в OSWorld выглядит впечатляюще, но чистый прирост поколения лучше оценивать по 57,2 против 47,6.
Artificial Analysis независимо получил для Muse Spark 1.3 в xhigh 61 балл собственного Intelligence Index против 57 у Muse Spark 1.2. Режим max набрал 62. Новая модель находится среди самых сильных коммерческих систем, но не становится безоговорочным лидером. Claude Opus 5 и другие передовые модели сохраняют преимущество в отдельных классах задач.
Интересна и небольшая регрессия. Artificial Analysis зафиксировал снижение результата своего теста длинного контекста AA-LCR с 83 до 79. В тесте на фактическую уверенность Muse Spark 1.3 также чаще отказывалась отвечать, если не была уверена. Формальная точность из-за отказов немного снизилась, зато уменьшилась доля галлюцинаций. Для рабочего агента я скорее выберу подобное поведение. Фраза «не знаю» обычно дешевле выдуманного результата, который программа затем запишет в базу данных или отправит клиенту.
Миллион токенов, видео и очень необычная цена
Контекст Muse Spark 1.3 составляет примерно один миллион токенов. Модель принимает текст, изображения, документы и видео. Такой объём позволяет передать большой репозиторий, набор технической документации или длинную историю работы агента. Миллион токенов не появился в версии 1.3 впервые, поэтому считать размер контекста главным нововведением неправильно.
С аудио ситуация хуже. Документация Meta предупреждает, что понимание звука в Muse Spark 1.3 пока поддерживается не полностью и качество может снижаться. Для задач с аудиозаписями компания рекомендует предыдущую Muse Spark 1.2 либо отдельную модель Muse Voice Transcribe. Поэтому автоматическая замена 1.2 на 1.3 во всех производственных сценариях может дать неожиданную регрессию.
Стандартный доступ через Meta Model API стоит $1,25 за миллион входных токенов и $4,25 за миллион выходных. Чтение закэшированного контекста стоит $0,15 за миллион токенов. По меркам передовых рассуждающих моделей тариф довольно агрессивный.
Гораздо интереснее вариант muse-spark-1.3-contributor. Входные токены стоят $0,10 за миллион, выходные $0,20, закэшированные входные данные $0,002. Разница огромная и объясняется не урезанной моделью. В тарифе Contributor Meta может использовать отправленные запросы и ответы для улучшения своих моделей.
Поэтому цена в $0,10 выглядит совсем иначе, если агент получает исходный код закрытого продукта, клиентские документы, внутреннюю переписку или коммерческие данные. Для открытых проектов, экспериментов и синтетических данных Contributor может оказаться исключительно выгодным. Для корпоративной разработки сначала нужно проверить требования к конфиденциальности и договорные ограничения. Выбирать такой тариф только по строке с ценой я бы не стал.
Artificial Analysis подсчитал около $0,55 расходов на одну задачу своего Intelligence Index для Muse Spark 1.3 в xhigh. Среди моделей с сопоставимым итоговым баллом показатель очень хороший. Важнее другое. Старая Muse Spark 1.2 обходилась в том же тесте дешевле, несмотря на одинаковую цену токена, потому что новая версия в некоторых агентных заданиях потребляет больше входного контекста. Низкий тариф API ещё не гарантирует минимальную стоимость законченной задачи.
Кому стоит переходить на Muse Spark 1.3
Я вижу у Muse Spark 1.3 довольно конкретную специализацию. Модель интересна разработчикам, которые строят автономных агентов, работают с большими репозиториями, дают модели доступ к инструментам или заставляют её вести одну задачу через десятки последовательных действий. Именно там результаты относительно 1.2 выросли сильнее всего.
Для обычного чата переход выглядит гораздо менее принципиальным. Meta не показала скачка такого масштаба, чтобы любой пользователь сразу почувствовал новое поколение. Muse Spark 1.3 скорее стала лучшим рабочим механизмом для систем вокруг модели.
- Для программирования. Переход выглядит оправданным. Terminal-Bench и SWE-Atlas заметно выросли, а цена API не увеличилась.
- Для автономных агентов. Версия 1.3 интереснее благодаря улучшениям в OSWorld, автоматизации, работе с инструментами и длинными инструкциями.
- Для огромных документов и репозиториев. Улучшение извлечения информации из контекста стало одним из самых заметных результатов релиза.
- Для аудио. Пока разумнее оставить Muse Spark 1.2 или использовать специализированную модель распознавания речи.
- Для конфиденциальных данных. Стандартный тариф выглядит безопаснее Contributor с точки зрения дальнейшего использования запросов Meta.
Есть и более широкий вывод. Meta постепенно отходит от идеи, что соревнование моделей сводится к тому, кто лучше отвечает на отдельный сложный вопрос. В агентных системах гораздо важнее способность не потерять цель после пятидесятого действия, правильно вызвать инструмент, понять ошибку, не придумать успешный результат и остановиться перед опасным изменением.
Muse Spark 1.3 показывает заметный прогресс именно здесь. Модель не лучшая абсолютно во всех тестах, а режим max делает часть рекламных сравнений более эффектной, чем прямое сопоставление одинаковых настроек. Но версия xhigh тоже ощутимо обгоняет Muse Spark 1.2 в тех задачах, ради которых семейство сейчас развивает Meta. При прежней цене API переход для новых проектов выглядит логичным.
Главный вопрос теперь не в том, может ли Muse Spark написать хороший фрагмент кода. Современные модели давно умеют подобное. Интереснее проверить, сможет ли агент получить задачу утром, несколько часов самостоятельно работать с большим проектом и к вечеру вернуть результат, который разработчику не придётся переделывать с нуля. Muse Spark 1.3 приблизила такой сценарий, но до полностью автономного и безошибочного «цифрового сотрудника» индустрии всё ещё далеко.
Что такое Muse Spark 1.3?
Muse Spark 1.3 представляет собой закрытую мультимодальную модель Meta, оптимизированную для программирования, ИИ-агентов, работы с инструментами и длинным контекстом.
Чем Muse Spark 1.3 лучше Muse Spark 1.2?
Наиболее заметный прирост виден в управлении компьютером, агентной автоматизации, понимании больших кодовых баз и извлечении информации из очень длинного контекста. В отдельных тестах улучшение небольшое или отсутствует.
Какой размер контекста у Muse Spark 1.3?
Контекстное окно составляет примерно один миллион токенов. Большой контекст подходит для крупных репозиториев, документов и продолжительных агентных сессий, но сам размер окна не гарантирует глубокого понимания всего содержимого.
Сколько стоит Muse Spark 1.3?
Стандартный API стоит $1,25 за миллион входных и $4,25 за миллион выходных токенов. Тариф Contributor значительно дешевле, но отправленные данные могут использоваться Meta для улучшения моделей.
Можно ли скачать Muse Spark 1.3 и запустить локально?
Пока нет. Muse Spark 1.3 остаётся закрытой моделью и доступна через сервисы Meta. Компания заявила о планах выпустить открытые веса Muse Spark в будущем, но конкретные параметры будущего релиза пока не опубликованы.
Стоит ли переходить с Muse Spark 1.2 на 1.3?
Для новых проектов с кодом, инструментами и длинными агентными сценариями переход выглядит оправданным. Пользователям, которые активно работают с аудио, пока лучше отдельно протестировать 1.3 или остаться на предыдущей версии.
* Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.