NVIDIA открыла веса Nemotron 3.5 Lightning для локального запуска ИИ-агентов

NVIDIA выпустила открытую модель Nemotron 3.5 Lightning для постоянно работающих автономных ИИ-агентов. В основе лежит гибридная архитектура Mixture-of-Experts, объединяющая слои Mamba-2, MoE и Attention. Из общих 30 млрд параметров при генерации активируются только 3 млрд. Это повышает скорость работы до четырех раз по сравнению с моделями аналогичного размера. Контекст составляет до 1 млн токенов. Модель запускается на одной видеокарте H100 или RTX 5090.
Для быстрого вывода используются форматы NVFP4 и W4A16, а также алгоритмы спекулятивного декодирования. На тестах агентских систем модель обходит конкурентов по скорости. В бенчмарке PinchBench она набирает более 83% точности. Массив из 10 000 задач выполняется на 35% быстрее Qwen3.6 35B. В тестах программирования SWE-bench Verified результат достигает 52.80.
Модель распространяется по открытой лицензии OpenMDW 1.1. Доступны веса, тренировочные данные и рецепты для развертывания через vLLM. Систему можно дообучать на собственных датасетах и интегрировать в RAG-пайплайны. Низкое потребление ресурсов позволяет разворачивать локальных агентов на пользовательском железе без потери скорости.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад