Qwen 4 и Qwen3.8-Flash-Next - как Alibaba перестраивает архитектуру больших языковых моделей

1265
Qwen 4 и Qwen3.8-Flash-Next - как Alibaba перестраивает архитектуру больших языковых моделей

Меня давно перестали впечатлять релизы нейросетей по формуле «добавили параметров, купили больше ускорителей, получили ещё несколько процентов в тестах». Поэтому Qwen 4 заинтересовал меня совсем по другой причине. Alibaba пытается сделать большую языковую модель умнее не только за счёт дополнительных вычислений. Команда Qwen перестраивает память, внимание, остаточные связи, смесь экспертов и даже сам процесс обучения так, чтобы модель как можно реже считала то, что считать необязательно.

С названием здесь есть небольшая ловушка. Полноценный Qwen 4 пока не выпущен. Сейчас доступна Qwen3.8-Flash-Next, которую сама команда Qwen называет экспериментальным предварительным показом архитектуры будущего Qwen 4. В официальной карточке модели архитектура помечена идентификатором qwen4_exp. Поэтому дальше я разбираю не готовый Qwen 4, а двигатель, на котором Alibaba собирается строить следующее семейство.

180 миллиардов параметров, но считать приходится далеко не все

Qwen3.8-Flash-Next выглядит огромной. Основной языковой граф содержит 125 млрд параметров. К нему добавлены 51 млрд параметров N-gram Embedding и около 4 млрд параметров Multi-Token Prediction. В сумме получается примерно 180 млрд.

Но при обработке одного токена основной граф активирует около 6 млрд параметров. Причина в архитектуре Mixture of Experts. Модель содержит 512 экспертов, однако маршрутизатор отправляет каждый токен только к десяти выбранным экспертам плюс одному общему. Полные характеристики Alibaba приводит в описании модели.

Характеристика Qwen3.8-Flash-Next
Основной граф 125 млрд параметров
Активно на токен около 6 млрд параметров
N-gram Embedding 51 млрд параметров
Multi-Token Prediction около 4 млрд параметров
Слои 48
Эксперты 512
Активные эксперты 10 маршрутизируемых и 1 общий
Нативный контекст открытой модели 262 144 токена
Расширенный контекст до 1 млн токенов
Вход текст, изображения, видео

Фраза «6 млрд активных параметров» легко вводит в заблуждение. Qwen3.8-Flash-Next не превращается от этого в обычную модель класса 6B. Для вычислений действительно используется только небольшая часть MoE-графа, но сотни миллиардов остальных параметров всё равно приходится где-то хранить.

Поэтому я бы не повторял эффектную формулу «работает как 6B, знает как 180B». Вычислительная цена одного токена действительно резко снижается, но требования к памяти остаются серьёзными. Alibaba оптимизировала вычисления, а не отменила физику.

Самое интересное начинается с памяти

Обычный Transformer хорошо умеет смотреть назад. Каждый новый токен может обращаться к предыдущим токенам через механизм внимания. Проблема появляется, когда история разрастается до сотен тысяч токенов. Увеличиваются объём KV-кэша, обмен с памятью и стоимость обработки контекста.

Qwen3.8-Flash-Next использует гибридную схему. 48 слоёв собраны в двенадцать одинаковых групп. В каждой сначала идут три слоя Gated DeltaNet, затем слой Qwen Sparse Attention. Точная структура опубликована в официальном репозитории.

Gated DeltaNet можно представить как постоянно обновляемый конспект. Вместо хранения полной истории для каждого слоя механизм сворачивает прошлую информацию в состояние фиксированного размера. Чем длиннее становится диалог, документ или работа агента, тем привлекательнее такая схема. Память не обязана линейно раздуваться вместе с количеством прочитанных токенов.

Но у любого конспекта есть слабое место. Общий смысл можно сохранить прекрасно, а конкретную фамилию, номер строки или значение переменной потерять. Поэтому Alibaba периодически возвращает полноценный механизм внимания, но делает его разреженным.

Qwen Sparse Attention, или QSA, сначала не пытается внимательно читать всю историю. Небольшой индексатор оценивает микроблоки контекста и выбирает наиболее полезные. Полноценное внимание работает уже только по выбранным фрагментам.

В текущей конфигурации QSA получает бюджет 512 блоков, соответствующих примерно 2048 токенам. При миллионном контексте разница принципиальная. Вместо дорогого внимания по всей последовательности модель пытается сначала понять, где вообще стоит искать ответ.

Мне такая конструкция кажется намного интереснее очередного увеличения окна контекста. Миллион токенов сам по себе мало что значит, если каждый запрос заставляет сервер дорого перелопачивать весь миллион. QSA пытается превратить огромное окно из демонстрационного числа в реально обслуживаемую память.

По внутренним измерениям Qwen, опубликованным в техническом анонсе, при очень длинном контексте специализированное ядро QSA способно заметно обгонять полное внимание как при первоначальной обработке последовательности, так и во время генерации. Я сознательно не превращаю конкретные коэффициенты ускорения в универсальное обещание. Результат зависит от длины последовательности, серверной конфигурации, реализации ядра и кэширования. На коротком запросе пользователь совершенно не обязан увидеть ускорение того же масштаба.

51 миллиард параметров, которые почти не нужно вычислять

Самая возбуждающая часть архитектуры для меня вообще не QSA. Alibaba добавила N-gram Embedding на 51 млрд параметров.

Обычные токенные эмбеддинги сопоставляют отдельному токену обучаемый вектор. Qwen дополнительно индексирует короткие последовательности из двух и трёх токенов. Для них используется огромная таблица примерно на 20 млн записей.

Звучит так, будто Alibaba просто прикрутила ещё 51 млрд дорогих параметров. Но здесь есть принципиальная разница. Для каждого токена не нужно перемножать матрицы размером в десятки миллиардов параметров. Последовательность токенов вычисляет адрес, после чего система читает конкретную запись из таблицы.

Проще говоря, часть ёмкости модели превращается из вычислительной в адресуемую.

И вот здесь, на мой взгляд, находится действительно интересная инженерная идея. Большие языковые модели привыкли хранить почти всё внутри весов, которые приходится постоянно прогонять через ускорители. Qwen показывает другой путь. Если некоторую информацию можно получить дешёвым обращением к памяти, зачем каждый раз заново вычислять её дорогими матричными операциями?

В репозитории Qwen команда отдельно описывает возможность асинхронно подготавливать N-gram Embedding и выносить соответствующие данные в память хоста. Для ускорителей с ограниченной видеопамятью такой подход особенно интересен. Очень большой кусок параметров уже не обязан постоянно занимать самый дорогой уровень памяти.

Разумеется, N-gram Embedding не превращается в базу фактов и не заменяет рассуждение. Короткие последовательности хорошо кодируют локальные закономерности языка и повторяющиеся конструкции, но смысл длинного документа, причинность и решение новой задачи по-прежнему требуют основной нейросети. Я бы воспринимал n-граммную память не как дополнительный мозг, а как дешёвый слой ёмкости.

Ещё одна новая деталь называется Gated Residual. В классическом Transformer информация проходит через один остаточный поток. Qwen расширяет поток до четырёх ветвей и позволяет слоям управлять чтением и записью через обучаемые затворы. По замыслу разработчиков, такая схема помогает информации ранних слоёв проходить глубже в сеть и уменьшает разрушительное смешивание разных сигналов.

Даже здесь команда думает о памяти. Остаточное состояние допускается хранить в FP8, снижая объём передачи данных между памятью и вычислительными блоками.

Alibaba оптимизирует уже не модель, а всю экономику вычислений

Изменения затронули и обучение. Qwen применяет оптимизаторы Muon и AdamW к разным категориям параметров. Основные двумерные матрицы переводятся на Muon, а эмбеддинги, маршрутизаторы и отдельные служебные веса остаются на AdamW.

Команда также пересмотрела традиционное постепенное увеличение размера пакета в начале обучения. По собственным экспериментам Qwen, такой разгон больше не давал достаточной пользы и заставлял выполнять лишние шаги оптимизатора. В новой схеме обучение сразу начинается с целевого размера пакета.

Мне здесь нравится общий инженерный подход. Разработчики не нашли одну волшебную оптимизацию. Alibaba последовательно атакует дорогие части LLM с разных сторон. MoE уменьшает количество активных весов, GDN ограничивает рост состояния, QSA сокращает область дорогого внимания, N-gram Embedding переносит ёмкость в дешёвую память, FP8 уменьшает трафик, а новый рецепт обучения экономит шаги оптимизатора.

Каждая отдельная идея выглядит умеренной. Вместе они меняют характер системы.

А что с качеством

В опубликованной Qwen таблице тестов модель показывает сильные результаты в программировании, использовании инструментов, научных вопросах, работе с компьютером и мультимодальных задачах. Например, разработчики сообщают 62,5 балла на SWE-bench Pro, 91,7 на GPQA Diamond и 91,9 на LiveCodeBench v6.

Я бы относился к такой таблице спокойно. Перед нами результаты самого разработчика. Более того, условия разных сравнений не всегда полностью одинаковы. Qwen прямо указывает, что для отдельных моделей используются опубликованные внешние результаты, тогда как собственные модели команда тестирует самостоятельно. Некоторые наборы задач вообще разработаны внутри Qwen.

Поэтому из таблицы можно сделать вывод, что архитектура не развалила качество ради скорости. Делать вывод «Qwen уже победил все остальные модели» я бы не стал. Нужна реальная эксплуатация на кодовых базах, длинных документах, многошаговых агентах и задачах, которых не было в тренировочных и тестовых наборах.

Меня сильнее впечатляет другое. Qwen3.8-Flash-Next одновременно остаётся мультимодальной моделью. Она принимает текст, изображения и видео, поддерживает вызов инструментов и режим рассуждений. Архитектурные эксперименты не ограничились академической языковой моделью, которую невозможно использовать вне лаборатории.

Миллион токенов не означает идеальную память

С контекстом тоже нужна аккуратность. Открытая Qwen3.8-Flash-Next нативно рассчитана на 262 144 токена и допускает расширение до миллиона. Облачная Qwen3.8-Flash, построенная на той же архитектуре, уже предлагает окно в 1 млн токенов.

QwenCloud указывает максимальный вход примерно 991 тысячу токенов, выход до 131 тысячи и отдельный лимит рассуждений до 262 тысяч токенов.

Но размер окна и качество памяти нельзя считать синонимами. Возможность отправить модели огромный репозиторий ещё не гарантирует, что через сотни тысяч токенов она безошибочно найдёт одну нужную строку. У QSA появляется собственная точка отказа. Индексатор может решить, что нужный блок несущественен, и дорогое внимание просто не увидит его.

У GDN другая проблема. Сжатие неизбежно означает потерю части информации. Поэтому гибрид QSA и GDN выглядит логично, но магии здесь нет. Alibaba скорее пытается найти приемлемый компромисс между точностью памяти и ценой, чем полностью решить проблему длинного контекста.

Попробовать уже можно

Открытые веса Qwen3.8-Flash-Next опубликованы в официальном репозитории модели. Qwen указывает поддержку Transformers, vLLM, SGLang и других движков.

Например, сервер через vLLM запускается буквально одной командой.

pip install vllm
 
 vllm serve "Qwen/Qwen3.8-Flash-Next"

После запуска к модели можно обращаться через совместимый с OpenAI интерфейс.

from openai import OpenAI
 
 client = OpenAI(
     base_url="http://localhost:8000/v1",
     api_key="EMPTY"
 )
 
 response = client.chat.completions.create(
     model="Qwen/Qwen3.8-Flash-Next",
     messages=[
         {
             "role": "user",
             "content": "Объясни архитектуру этого проекта и найди слабые места"
         }
     ],
     extra_body={
         "chat_template_kwargs": {
             "enable_thinking": True
         }
     }
 )
 
 print(response.choices[0].message.content)

Но слово «локально» здесь не должно создавать иллюзий. Модель огромная. Шесть миллиардов активных параметров не означают, что полный набор весов внезапно помещается на обычную игровую видеокарту. Квантизация и выгрузка части данных в оперативную память расширяют варианты запуска, но комфортная работа с таким классом моделей по-прежнему требует серьёзного железа.

Для большинства пользователей разумнее облачная Qwen3.8-Flash. На момент проверки QwenCloud указывает $0,15 за миллион обычных входных токенов, $0,47 за миллион выходных и $0,016 за миллион входных токенов при попадании в кэш. Тарифы облачных моделей меняются, поэтому перед расчётом реальной стоимости я бы всегда перепроверял страницу сервиса.

Есть и юридическая деталь. Qwen3.8-Flash-Next распространяется не под Apache 2.0, а под Qwen Community License 1.0. Лицензия разрешает скачивание, изменение, развёртывание и создание производных работ, но вводит отдельные условия для коммерческих сервисов класса Model as a Service и самостоятельных ИИ-помощников для программирования или офисной работы. Таким компаниям может потребоваться отдельная лицензия Qwen.

Есть требования и для очень крупных коммерческих продуктов. При аудитории свыше 100 млн активных пользователей в месяц или месячной выручке более $20 млн название используемой модели должно заметно отображаться в интерфейсе. Поэтому я бы называл Qwen3.8-Flash-Next моделью с открытыми весами, а не безоговорочно «полностью открытой» моделью.

Почему Qwen 4 выглядит намного интереснее очередного рекорда

Меня в этой истории возбуждают не 62,5 балла на очередном тесте и не миллион токенов в рекламной таблице. Qwen3.8-Flash-Next показывает возможную смену инженерного подхода к большим языковым моделям.

  • MoE позволяет хранить огромную модель, не активируя её целиком для каждого токена.
  • Gated DeltaNet пытается удерживать длинную историю без бесконечного роста состояния.
  • Qwen Sparse Attention ищет нужные участки вместо дорогого просмотра всего контекста.
  • N-gram Embedding добавляет десятки миллиардов параметров ёмкости без сопоставимого увеличения матричных вычислений.
  • Gated Residual создаёт несколько каналов передачи информации между слоями.
  • Новый рецепт обучения пытается получить больше качества за тот же вычислительный бюджет.

Ограничения никуда не исчезли. Разреженная модель остаётся огромной. Миллион токенов не гарантирует идеальной памяти. QSA способен выбрать неправильный фрагмент. GDN что-то теряет при сжатии истории. N-gram Embedding хорошо хранит локальные закономерности, но не заменяет полноценное рассуждение. Собственные тесты разработчика ещё предстоит проверять на практике. Финальный Qwen 4 может получить другие размеры и даже изменённый набор архитектурных компонентов.

Но направление мне нравится гораздо сильнее бесконечной гонки параметров. Последние годы индустрия в основном спрашивала, сколько ещё вычислений можно бросить в Transformer. Alibaba задаёт более полезный вопрос.

Зачем вычислять всё, если большую часть можно вообще не вычислять?

Если финальный Qwen 4 сохранит этот принцип, самое интересное в новом поколении будет не в том, обгонит ли китайская модель GPT или Claude на несколько пунктов. Гораздо важнее возможность получить модель с огромной ёмкостью, длинной памятью и агентными возможностями без пропорционального роста вычислительной цены. Именно такой технологический сдвиг я считаю действительно возбуждающим.

Alibaba Qwen Qwen 4 Qwen3.8-Flash-Next искусственный интеллект нейросеть языковая модель
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
SECLAB / TG
LIVE SecurityLab.ru
Вы зашли хитро.
Дальше — совсем просто.
Одна кнопка — и SecurityLab в вашей ленте. Новости про взломы без лишних маршрутов.
Подписаться @SecLabnews

Юрий Кочетов

Здесь я делюсь своими не самыми полезными, но крайне забавными мыслями о том, как устроен этот мир. Если вы устали от скучных советов и правильных решений, то вам точно сюда.