Alibaba показала ИИ, который 16 дней подряд самостоятельно писал и правил код

6262
Alibaba показала ИИ, который 16 дней подряд самостоятельно писал и правил код

Китайский ИИ обошёл почти весь мир — уступил только моделям Claude.

image

Новая нейросеть Alibaba получила программный проект и работала над задачей 16 дней. По заявлению компании, Qwen3.8-Max самостоятельно вносила изменения в код и выполняла последовательность длительных операций. Эксперимент стал одной из главных демонстраций возможностей крупнейшей и самой производительной модели в истории семейства Qwen.

Alibaba представила Qwen3.8-Max с 2,4 трлн параметров. Компания позиционирует разработку как конкурента передовым системам Anthropic и OpenAI. После анонса акции Alibaba Group на торгах в Гонконге подорожали на 7%.

Qwen3.8-Max использует архитектуру «смесь экспертов», которая распределяет запросы между специализированными частями нейросети. При выполнении одной задачи система активирует около 95 млрд из 2,4 трлн параметров. Архитектура сокращает вычислительные расходы и задержку, поскольку оборудование не обрабатывает всю модель одновременно, уточняет Reuters.

Модель принимает текст, изображения и видео, а контекстное окно вмещает до одного миллиона токенов. Подобный объем позволяет загрузить в один запрос сотни страниц документов, длинные юридические материалы или крупную базу исходного кода. Alibaba особенно выделяет способности Qwen3.8-Max к автономному программированию, исследовательской работе и выполнению многоэтапных заданий, рассчитанных на продолжительное время.

После публикации Qwen3.8-Max стала самой высоко оцененной китайской текстовой моделью в рейтинге Arena.AI. Разработка уступила Claude Fable 5 и трем вариантам Claude Opus от Anthropic. В отдельном рейтинге систем для анализа изображений модель Alibaba заняла второе место в мире, пропустив вперед только одну версию Claude Fable 5.

Qwen3.8-Max также превзошла в нескольких тестах Kimi K3 от китайского стартапа Moonshot AI. Конкурирующая нейросеть содержит 2,8 трлн параметров, однако больший размер сам по себе не гарантирует более высокое качество. Число параметров прежде всего показывает масштаб архитектуры и объем вычислений, необходимых для обучения и запуска.

Доступ к Qwen3.8-Max через программный интерфейс QwenCloud стоит два доллара за миллион входных токенов и шесть долларов за миллион выходных. Кэширование позволяет дополнительно сократить расходы при повторной обработке одинаковых фрагментов. Цена особенно важна для программных агентов, способных за одну задачу отправлять множество запросов и обрабатывать большие объемы кода или документов.

Команда Qwen планирует опубликовать веса Qwen3.8-Max на следующей неделе. Разработчики смогут загружать модель, запускать на собственной инфраструктуре и адаптировать под специализированные задачи. Alibaba также готовит к публикации веса более компактной Qwen3.8-27B, говорится в сообщении разработчиков.

Открытые веса не означают, что Qwen3.8-Max получится запустить на обычном компьютере. Полная версия содержит 2,4 трлн параметров и потребует серверного кластера с большим объемом памяти. Более компактная Qwen3.8-27B подойдет компаниям и разработчикам, которым важен локальный запуск без передачи запросов внешнему облачному сервису.

Анонс продолжил серию крупных релизов китайских ИИ-компаний. Moonshot AI недавно представила Kimi K3, а DeepSeek расширила доступ к V4-Flash. По оценке исследовательской компании Artificial Analysis, новая система DeepSeek стала одной из самых дешевых в эксплуатации передовых моделей: средняя стоимость одного теста составила три цента против 86 центов у Kimi K3, $1,86 у GPT-5.6 Sol и $3,15 у Claude Fable 5.

DeepSeek V4-Flash содержит 284 млрд параметров, но при обработке запроса активирует только 13 млрд. Контекстное окно вмещает до одного миллиона токенов. Значительно меньший размер позволяет снизить требования к оборудованию по сравнению с Qwen3.8-Max, хотя для локального запуска по-прежнему потребуется мощный сервер или рабочая станция с большим объемом памяти.

Обновленная DeepSeek V4-Flash-0731 получила улучшенные возможности для программных агентов и встроенную технологию DSpark. Механизм спекулятивного декодирования заранее предлагает несколько следующих токенов, после чего основная часть нейросети проверяет прогноз. Успешное предсказание ускоряет генерацию, а ошибка заставляет модель продолжить вычисления обычным способом.

Разработчики встроили вспомогательный модуль DSpark в один набор весов с основной моделью, поэтому отдельную черновую нейросеть загружать не требуется. DeepSeek поддерживает запуск через vLLM и SGLang, а опубликованные варианты сжатия подходят для llama.cpp, Ollama и LM Studio. Веса распространяются по лицензии MIT, которая разрешает модификацию и коммерческое применение.

По собственным тестам DeepSeek, версия V4-Flash-0731 превзошла значительно более крупную V4-Pro Preview в ряде заданий для программных агентов. Результаты разработчика требуют независимой проверки, однако релиз показывает общую стратегию китайских компаний: Alibaba наращивает максимальный масштаб, а DeepSeek пытается получить сопоставимое качество при меньшем числе активных параметров и более низкой стоимости вычислений.

Сравнение только по цене миллиона токенов не всегда показывает реальные расходы. Одна нейросеть может стоить дешевле за токен, но использовать намного более длинную цепочку рассуждений. Поэтому при выборе модели компаниям приходится учитывать стоимость завершенной задачи, скорость ответа, качество результата и требования к собственной инфраструктуре.