Релиз DeepSeek-V4-Flash-0731: агентские функции, спекулятивное декодирование и результаты в бенчмарках

DeepSeek выпустили финальную версию DeepSeek-V4-Flash-0731. Модель получила апгрейд агентских функций и встроенный модуль спекулятивного декодирования DSpark. При меньшем числе активных параметров она обходит прошлую Pro-версию. В бенчмарке DeepSWE результат вырос до 54.4%, а в TerminalBench — до 82.7%. Это ставит открытую модель в один ряд с проприетарным Opus-4.8. По данным разработчиков, добавлена совместимость с Codex и поддержка Responses API.
Разработчики отказались от Jinja-шаблонов. Форматирование сообщений под OpenAI API теперь работает через Python-скрипты из директории encoding. Появился параметр reasoning_effort с тремя уровнями: low, high и max. Он определяет время на предварительные вычисления перед ответом. Для высоких уровней авторы советуют ставить лимит генерации в 384K токенов.
Сервинг через vLLM требует одного флага — --speculative-config с методом dspark. В движке SGLang ускорение включается параметром --speculative-algorithm DSPARK. Отдельный путь к draft-модели не нужен, веса подтягиваются из основного чекпоинта. При локальном развертывании для агентских сценариев оптимальны temperature = 1.0 и top_p = 0.95.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад