Meituan выпустила LongCat-2.0: MoE-модель на 1,6 трлн параметров, обученная на 50 тысячах ASIC

Meituan открыла исходный код LongCat-2.0. Это MoE-модель на 1,6 трлн параметров с 48 млрд активных весов на токен. Главная техническая особенность релиза — полный отказ от GPU Nvidia. Претрейн на 35 трлн токенов проходил на кластере из 50 тысяч китайских AI ASIC. По архитектуре они близки к чипам Huawei Ascend 910C. Ранее таких масштабов достигали только на железе Nvidia и TPU от Google.
Для обработки длинных запросов инженеры переработали механизм внимания из DeepSeek. Новая реализация LongCat Sparse Attention решает проблему узкого места в индексаторе. Этого добились за счет потокового чтения из памяти и иерархического скоринга. Модель целенаправленно тренировали на массиве данных с контекстом в 1 млн токенов. Эффективность параметров повысили через модуль N-gram Embedding на 135 млрд весов. Он расширяет пространство эмбеддингов почти в 100 раз. Это ощутимо снижает I/O-нагрузку на память при декодировании больших батчей.
Аппаратные ограничения китайских ASIC потребовали сложных решений для распределения нагрузки. Памяти на одном таком чипе меньше, чем в стандартном ускорителе H800. Поэтому разработчики применили сложный 6D-параллелизм. К стандартным методам шардирования добавили алгоритм EMBP для распараллеливания N-gram вычислений. Мониторинг инфраструктуры позволил провести миллионы часов вычислений без единого отката чекпоинта. На выходе получилась модель для сложных задач программирования. Она нативно поддерживает агентные фреймворки вроде Claude Code и OpenClaw для автономной работы с репозиториями.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад