27B параметров в 4 ГБ: PrismML сжала Qwen3.6 до 1-битного формата для запуска на смартфонах

PrismML представила Bonsai 27B — первую модель класса 27B для локального запуска на смартфонах. Базой послужила мультимодальная Qwen3.6-27B. За счет экстремального квантования размер исходной FP16-модели сократили с 54 ГБ до 3,9 ГБ. Это сжатие почти в 14 раз без потери основных навыков.
Модель доступна под лицензией Apache 2.0 в двух вариантах. Обе версии мультимодальны, поддерживают контекст на 262K токенов и работу с агентами.
- 1-bit Bonsai 27B занимает 3,9 ГБ. Алгоритм использует бинарные веса {−1, +1}, давая 1,125 эффективного бита. Версия помещается в память iPhone 17 Pro и сохраняет 90% бенчмарков оригинала.
- Ternary Bonsai 27B весит 5,9 ГБ. Работает на тернарных весах {−1, 0, +1} с 1,71 бита на вес. Это вариант для ноутбуков, который удерживает 95% производительности базовой модели.
Низкобитное представление работает через всю архитектуру сети. Визуальный энкодер сжат до 4 бит, позволяя моделям читать документы и скриншоты. На RTX 5090 бинарная версия выдает 163 токена в секунду. На Apple M5 Max скорость достигает 87 токенов. Локальный запуск таких моделей сводит стоимость многошаговых агентских циклов к нулю. Приватные данные пользователя остаются строго на устройстве.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад