NVIDIA Nemotron 3.5 Lightning: открытая MoE-модель для ИИ-агентов с окном контекста 1 млн токенов

NVIDIA выпустила открытую модель Nemotron 3.5 Lightning, заточенную под непрерывную работу ИИ-агентов. Это гибридная архитектура Mixture-of-Experts (MoE) на 30 млрд параметров, из которых при каждом запросе активируются только 3 млрд. Такой подход дает скорость генерации до четырех раз выше, чем у монолитных моделей сопоставимого размера. Сейчас к ней открыт бесплатный доступ через API OpenRouter с огромным окном контекста в 1 млн токенов и лимитом вывода до 65 тысяч токенов.
Для автономных систем это один из лучших вариантов по соотношению скорости и качества на данный момент! На тестах PinchBench модель показала точность 86% и обработала 10 000 задач на 35% быстрее, чем Qwen3.6 35B, не уступив в качестве ответов. При пропускной способности в 41 токен в секунду и задержке ответа около 1.2 секунды, Nemotron отлично справляется с высоконагруженными сценариями, где важна моментальная реакция.
Модель достаточно компактна для локального запуска, а открытые веса позволяют дообучать ее под специфические корпоративные задачи и процессы. Для быстрого теста через OpenRouter достаточно передать nvidia/nemotron-3.5-lightning:free в параметре model, используя стандартные OpenAI-совместимые библиотеки.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад