ЗДЕСЬ медиа
huggingface.co

NVIDIA открыла веса Nemotron 3.5 Lightning для локального запуска ИИ-агентов

NVIDIA выпустила открытую модель Nemotron 3.5 Lightning для постоянно работающих автономных ИИ-агентов. В основе лежит гибридная архитектура Mixture-of-Experts, объединяющая слои Mamba-2, MoE и Attention. Из общих 30 млрд параметров при генерации активируются только 3 млрд. Это повышает скорость работы до четырех раз по сравнению с моделями аналогичного размера. Контекст составляет до 1 млн токенов. Модель запускается на одной видеокарте H100 или RTX 5090.

Для быстрого вывода используются форматы NVFP4 и W4A16, а также алгоритмы спекулятивного декодирования. На тестах агентских систем модель обходит конкурентов по скорости. В бенчмарке PinchBench она набирает более 83% точности. Массив из 10 000 задач выполняется на 35% быстрее Qwen3.6 35B. В тестах программирования SWE-bench Verified результат достигает 52.80.

Модель распространяется по открытой лицензии OpenMDW 1.1. Доступны веса, тренировочные данные и рецепты для развертывания через vLLM. Систему можно дообучать на собственных датасетах и интегрировать в RAG-пайплайны. Низкое потребление ресурсов позволяет разворачивать локальных агентов на пользовательском железе без потери скорости.

Поделиться:

Telegram

Ещё из архива

Все публикации
NVIDIA открыла веса Nemotron 3.5 Lightning для локального запуска ИИ-агентов - ЗДЕСЬ Медиа