ЗДЕСЬ медиа
huggingface.co

Meta выпустила мультимодальную модель Muse Glimmer 30B с фокусом на локальный запуск

Meta выпустила Muse Glimmer — 30-миллиардную мультимодальную модель, адаптированную для работы на потребительском железе. Это первый крупный открытый релиз компании за долгое время. В бенчмарках модель обходит прямых конкурентов вроде Qwen 3.6 27B и Gemma 4 31B. Архитектурно это dense-модель с отдельным энкодером восприятия. Она дистиллирована из старшей версии Muse Spark, веса которой Meta также пообещала открыть.

Главная задача Muse Glimmer — автономная работа агентов, многошаговый ризонинг и использование инструментов без доступа к облаку. Базовая квантованная версия на 16.8 ГБ помещается в 24 ГБ видеопамяти. Для обработки изображений нужен дополнительный модуль mmproj (1.4 ГБ), а для ускорения генерации через спекулятивное декодирование — драфтер dflash (1.6 ГБ). Из очевидных ограничений — окно контекста вмещает 131 тысячу токенов, что заметно меньше актуальных стандартов.

Для локального запуска потребуется свежий билд llama.cpp (начиная с версии b10353). При старте сервера критично использовать флаг --jinja — шаблон чата вшит в GGUF, без него парсер выдаст ошибку. Текстовые промпты обрабатывает llama-cli, а для мультимодальных задач нужен llama-mtmd-cli. Важный технический нюанс: нельзя использовать токен <|eom|> для принудительной остановки генерации. Он обозначает только конец сообщения, и его жесткая привязка к остановке ломает параллельный вызов инструментов.

Поделиться:

Telegram

Ещё из архива

Все публикации
Meta выпустила мультимодальную модель Muse Glimmer 30B с фокусом на локальный запуск - ЗДЕСЬ Медиа