ЗДЕСЬ медиа
cactuscompute.com

Локальная LLM Needle 2 весом 14 МБ для вызова функций и парсинга данных

Вышла Needle 2 — локальная LLM на 45M параметров для tool calling и генерации JSON. Вся модель упакована в единственный бинарный файл весом 14 МБ. Для работы сессии требуется всего 28 МБ оперативной памяти. Модель запускается на микроконтроллерах ESP32-S3, дешевых смартфонах и гарнитурах без GPU.

Движок написан на C++ без внешних зависимостей. При запуске он аппаратно анализирует процессор и выбирает оптимальное ядро. В основе лежит архитектура Simple Attention Network. Разработчики полностью отказались от пост-квантования. Модель изначально тренировалась в формате CQ2-bit. Веса не распаковываются в RAM, а вычисления идут в int8. Скорость декодирования на Raspberry Pi 5 достигает 500 токенов в секунду.

Needle 2 не предназначена для чатов или генерации текста. Ее задача — маппинг естественного языка на функции с типизированными аргументами. При извлечении данных движок компилирует грамматику из заданной схемы. Это полностью исключает появление невалидного JSON на выходе. На структурных токенах алгоритм пропускает до 98% вычислений проекции словаря. Модель можно быстро дообучить под свой набор инструментов на локальном ПК.

Поделиться:

Telegram

Ещё из архива

Все публикации
Локальная LLM Needle 2 весом 14 МБ для вызова функций и парсинга данных - ЗДЕСЬ Медиа