Архитектура и деплой Qwen 3.8 Max: 2.4 триллиона параметров в открытом доступе

Alibaba тихо выкатила веса Qwen 3.8 Max — самой крупной открытой модели на сегодня с 2.4 триллионами параметров. В активном режиме на токен задействуется 95B параметров. Оригинальные веса в bf16 занимают внушительные 5 терабайт, но сообщество уже собрало квантованные версии в NVFP4 и MXFP4. На визуальных VLM-задачах модель уже показывает результаты, превосходящие закрытые коммерческие решения.
В основе архитектуры лежит гибридный подход, масштабированный до 92 слоев. Разработчики скрестили Gated DeltaNet (GDN) и классическое GQA-внимание с Mixture-of-Experts. Из 512 экспертов активны 10 маршрутизируемых и один общий. Использование линейного внимания GDN со встроенным State Space Model дает потребление памяти O(1) на слой, сохраняя вычислительную сложность O(N). Это позволяет балансировать затраты на длинном контексте без потери качества генерации.
Для запуска такого массива требуются серьезные мощности — одна нода на топовых ускорителях вроде B300 или MI355X, либо кластер из карт предыдущих поколений. Команда SGLang оперативно подготовила day-0 рецепты для деплоя. Движок из коробки поддерживает спекулятивное декодирование через встроенную MTP-голову или драфт-модель DSpark, а также дает готовые конфигурации для мультинодовых сборок на чипах NVIDIA и AMD.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад