Muse Glimmer-30B от Meta: возвращение в средний вес или компромисс для локальных агентов

Все ждали от Meta очередного гиганта, но компания внезапно вернулась в категорию 30B, которую игнорировала со времен Code Llama. Muse Glimmer-30B позиционируется как движок для локальных автономных агентов. Разработчики заявляют мультимодальность, работу с инструментами и самовосстановление после ошибок прямо на домашнем железе. Но окно контекста всего в 131 тысячу токенов заставляет задуматься, насколько долгими могут быть эти агентские цепочки на самом деле.
Под капотом это классическая dense-архитектура, к которой добавили отдельный perception encoder на 1.8B параметров для работы с визуальными данными. Чтобы уместить модель в 24-32 ГБ видеопамяти, Meta использует 4-битную квантизацию, ужимая веса до 17 ГБ. Технический интерес здесь представляет встроенный драфтер на базе DFlash. Это спекулятивное декодирование предсказывает блоки по 16 токенов за проход, что на RTX 5090 дает прирост скорости в три раза — до 233 токенов в секунду. Правда, на чипах Apple M-серии ускорение выглядит куда скромнее, не превышая двукратного значения.
Согласно бенчмаркам, новинка действительно обходит Qwen3.6-27B и Gemma4-31B в профильных тестах вроде SWE-Bench Pro и MCP Atlas. Однако в метриках взаимодействия с операционной системой и терминалом китайские конкуренты всё еще удерживают лидерство. Meta делает ставку на скорость генерации и способность модели исправлять собственные ошибки вызовов на лету. Вопрос лишь в том, хватит ли разработчикам жестко ограниченного контекста для построения сложных систем без постоянного сброса памяти агента.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад