DeepSeek открыл DeepSpec: пайплайн для спекулятивного декодирования и алгоритм DSpark, ускоряющий инференс до 400%

DeepSeek выкатил DeepSpec — полноценную кодовую базу для обучения и оценки алгоритмов спекулятивного декодирования. Вместе с ней представили DSpark: метод генерации черновиков для DeepSeek V4 Flash и Pro, повышающий пропускную способность инференса на 51–400%. Архитектура не заперта внутри одной экосистемы: пайплайн изначально поддерживает работу с открытыми LLM, включая семейства Qwen3 и Gemma.
Фреймворк закрывает весь цикл работы с draft-моделями, от подготовки датасета до финального бенчмаркинга. Процесс строго последовательный, но требует серьезной инфраструктуры на этапе кеширования таргетов. Разработчики предупреждают, что базовая подготовка данных для Qwen/Qwen3-4B занимает около 38 ТБ дискового пространства. Само обучение запускается через простые bash-скрипты и по умолчанию рассчитано на ноду с восемью GPU.
Помимо DSpark, в репозиторий интегрированы алгоритмы DFlash и Eagle3, а готовые чекпоинты уже доступны для загрузки. Для продакшена со специфичными задачами авторы рекомендуют файн-тюнить draft-модели самостоятельно, особенно если целевая LLM будет работать в режиме рассуждения. Код открыт под лицензией MIT и базируется на архитектуре SpecForge, стандартизируя подходы к ускорению генерации текста.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад