DeepSeek-V4-Pro вышел из превью вместе с агентным фреймворком Harness. Что скрывается за новыми бенчмарками

Все привыкли считать, что каждый новый релиз открытых моделей — это безусловный удар по проприетарным API. DeepSeek-V4-Pro-0813 вышел из стадии превью под лицензией MIT, показав серьезный рост в агентных задачах. На бенчмарках модель действительно выглядит сильным конкурентом для условного Opus. Правда, для достижения заявленных результатов на уровне reasoning_effort="max" разработчики рекомендуют закладывать окно вывода до 384K токенов. Вопрос в том, сколько вычислительных мощностей потребуется на практике, чтобы переварить такие объемы внутренних размышлений алгоритма.
С точки зрения интеграции компания выбрала специфический путь. Привычные Jinja-шаблоны для промптов отправились под нож. Теперь для кодирования сообщений в OpenAI-совместимый формат нужно использовать предоставляемые Python-скрипты. Параллельно с моделью выпустили DeepSeek Harness — фреймворк с возможностью горячей замены коннекторов и самого агентного цикла, детально описанный в техническом отчете. Заявлена высокая модульность, но по факту это формирует обособленную экосистему, требующую адаптации привычных пайплайнов.
Главный нюанс кроется даже не во внедрении модуля спекулятивного декодирования DSpark, а в экономике самого проекта. Пока энтузиасты разворачивают открытые веса через vLLM, облачное API готовится к изменениям. С 16 августа стоимость входящих токенов вырастет в полтора раза, потянув за собой и цены на генерацию. Период работы на захват аудитории за счет низких прайсов ожидаемо завершается, заставляя разработчиков заново просчитывать юнит-экономику своих продуктов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад