DeepSeek V4.1 Flash: большая модель, которой нужно вчетверо меньше HBM

leer en español

11668
DeepSeek V4.1 Flash: большая модель, которой нужно вчетверо меньше HBM

Разработчики нашли способ снять одно из главных ограничений современных LLM.

image

DeepSeek показала, что гигантская модель не обязана съедать пропорционально больше быстрой памяти. Компания представила DeepSeek V4.1 Flash, у которой KV-кэш требует лишь четверть HBM по сравнению с V4 Flash. Речь идёт именно о памяти для контекста, а не о четырёхкратном сокращении всей памяти, нужной для весов модели. Для многопользовательских сервисов разница особенно важна.

Основа V4.1 Flash содержит 552 млрд параметров, а отдельная условная память Engram добавляет ещё 196 млрд. Полный набор файлов на Hugging Face достигает примерно 763 млрд параметров с учётом вспомогательных компонентов. При этом модель активирует около 8 млрд параметров при обработке запроса и 16 млрд при генерации ответа, поэтому размер весов и вычислительная нагрузка растут не одинаково.

Главную экономию даёт новая схема Causal Encoder-Decoder. Двадцать слоёв энкодера сначала обрабатывают вход, после чего двадцать слоёв декодера получают общий KV-кэш из итогового состояния энкодера, а не создают отдельные полные копии на каждом уровне. В описании модели DeepSeek указывает размер глобального KV-кэша 890 байт на токен. Такой кэш хранит состояние уже обработанного контекста.

Дополнительно Compressed Sparse Attention 2 переиспользует данные внимания между слоями, а основные записи KV-кэша хранятся в FP4. Постоянный кэш, который приходится переносить на накопители, сократился примерно до одной восьмой от V4 Flash. Такой подход продолжает курс, который DeepSeek уже выбрала в V4, где разработчики тоже сокращали стоимость длинного контекста.

Экономия HBM особенно заметна на фоне дефицита HBM, который усиливает бум ИИ-инфраструктуры. Чем меньше памяти занимает контекст каждого пользователя, тем больше одновременных сессий можно обслуживать на тех же ускорителях. DeepSeek оценивает выигрыш по KV-кэшу примерно в четыре раза относительно V4 Flash и в 437 раз относительно первого поколения.

V4.1 Flash поддерживает контекст до миллиона токенов и умеет работать с текстом и изображениями. Модель уже доступна через API и опубликована с открытыми весами по лицензии MIT. V4 Flash компания уже сняла с API, а с 14 сентября запросы к V4 Pro временно направит на V4.1 Flash до выпуска V4.1 Pro. Новая архитектура рассчитана на дальнейшее масштабирование.

Рекламодатель
ООО «СерчИнформ»
ИНН: 7704306397
searchinform.ru↗
ИИ-ассистент СерчИнформ