Открытая модель Qwen3.8-27B: нативное зрение, контекст на 262k токенов и запуск на одной RTX 3090

Разработчики выпустили Qwen3.8-27B под свободной лицензией Apache 2.0. Это один из самых плотных открытых релизов за последнее время. Качество кода и работы с агентами выросло радикально: в тестах Software engineering показатели подскочили с 49,3 до 79,0. Благодаря оптимизированным GGUF-квантизациям от команды Unsloth, запустить 27-миллиардную модель можно на одной домашней видеокарте уровня RTX 3090!
Внутри архитектуры работает гибрид слоев Gated DeltaNet и Gated Attention, а генерация ускоряется за счет Multi-Token Prediction. Модель нативно мультимодальна — она обрабатывает не только текст, но и сложные визуальные данные, включая часовые видеоролики. Базовое окно контекста составляет 262 тысячи токенов, но при использовании методов масштабирования вроде YaRN его можно расширить до миллиона.
Отдельный фокус сделан на логике внутренних рассуждений. Встроенный режим Thinking включен по умолчанию, при этом глубину размышлений можно регулировать через параметр reasoning_effort или полностью отключать для экономии ресурсов. Улучшенный парсинг вложенных объектов позволил нейросети гораздо стабильнее вызывать внешние инструменты и работать в связке с агентными фреймворками.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад