ЗДЕСЬ медиа
huggingface.co

Релиз DeepSeek-V4-Flash-0731: агентские функции, спекулятивное декодирование и результаты в бенчмарках

DeepSeek выпустили финальную версию DeepSeek-V4-Flash-0731. Модель получила апгрейд агентских функций и встроенный модуль спекулятивного декодирования DSpark. При меньшем числе активных параметров она обходит прошлую Pro-версию. В бенчмарке DeepSWE результат вырос до 54.4%, а в TerminalBench — до 82.7%. Это ставит открытую модель в один ряд с проприетарным Opus-4.8. По данным разработчиков, добавлена совместимость с Codex и поддержка Responses API.

Разработчики отказались от Jinja-шаблонов. Форматирование сообщений под OpenAI API теперь работает через Python-скрипты из директории encoding. Появился параметр reasoning_effort с тремя уровнями: low, high и max. Он определяет время на предварительные вычисления перед ответом. Для высоких уровней авторы советуют ставить лимит генерации в 384K токенов.

Сервинг через vLLM требует одного флага — --speculative-config с методом dspark. В движке SGLang ускорение включается параметром --speculative-algorithm DSPARK. Отдельный путь к draft-модели не нужен, веса подтягиваются из основного чекпоинта. При локальном развертывании для агентских сценариев оптимальны temperature = 1.0 и top_p = 0.95.

Поделиться:

Telegram

Ещё из архива

Все публикации