Meta выпустила мультимодальную модель Muse Glimmer 30B с фокусом на локальный запуск

Meta выпустила Muse Glimmer — 30-миллиардную мультимодальную модель, адаптированную для работы на потребительском железе. Это первый крупный открытый релиз компании за долгое время. В бенчмарках модель обходит прямых конкурентов вроде Qwen 3.6 27B и Gemma 4 31B. Архитектурно это dense-модель с отдельным энкодером восприятия. Она дистиллирована из старшей версии Muse Spark, веса которой Meta также пообещала открыть.
Главная задача Muse Glimmer — автономная работа агентов, многошаговый ризонинг и использование инструментов без доступа к облаку. Базовая квантованная версия на 16.8 ГБ помещается в 24 ГБ видеопамяти. Для обработки изображений нужен дополнительный модуль mmproj (1.4 ГБ), а для ускорения генерации через спекулятивное декодирование — драфтер dflash (1.6 ГБ). Из очевидных ограничений — окно контекста вмещает 131 тысячу токенов, что заметно меньше актуальных стандартов.
Для локального запуска потребуется свежий билд llama.cpp (начиная с версии b10353). При старте сервера критично использовать флаг --jinja — шаблон чата вшит в GGUF, без него парсер выдаст ошибку. Текстовые промпты обрабатывает llama-cli, а для мультимодальных задач нужен llama-mtmd-cli. Важный технический нюанс: нельзя использовать токен <|eom|> для принудительной остановки генерации. Он обозначает только конец сообщения, и его жесткая привязка к остановке ломает параллельный вызов инструментов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад