Генерация 30-секундных видео одним кадром: API Seedance 2.5 от ByteDance и разбор цен

Это лучшее обновление видеомоделей за последние месяцы. ByteDance раскатывает API Seedance 2.5, и его главная техническая особенность — честные 30 секунд генерации одним кадром без склеек. Но впечатляет другое: звук и картинка теперь просчитываются совместно в едином скрытом пространстве. Никакого наложения дорожек после рендера. Вы получаете нативное аудио, которое идеально синхронизировано с физикой объектов и ударами в кадре.
Управление моделью стало заметно точнее. Для генерации речи с липсинком достаточно обернуть фразы в двойные кавычки прямо внутри текстового промпта. API принимает до 50 мультимодальных референсов за один прогон — можно загрузить изображения, видеоклипы и стилевые подсказки для жесткого контроля над композицией. Дополнительно завезли умные параметры duration и aspect_ratio со значением auto, чтобы нейросеть сама подбирала оптимальный хронометраж и формат.
Ценник на такие мощности пока кусается, а разброс у провайдеров приличный! Напрямую у ByteDance тариф составляет около $10.37 за миллион токенов для text-to-video. Если использовать популярный fal, 30 секунд в разрешении 720p обойдутся почти в $14 (около $0.47 за секунду). Дешевле работать через агрегаторы вроде Atlas Cloud, где базовая ставка начинается от $0.134 за секунду. Важный нюанс: генерация звука не расходует дополнительные токены, поэтому отключать аудио ради экономии бессмысленно.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад