API Seedance 2.5: генерация 30-секундных видео с 50 мультимодальными референсами и анализ стоимости

ByteDance открыла доступ к API Seedance 2.5, где ключевым обновлением стал эндпоинт reference-to-video. Модель обрабатывает до 50 мультимодальных референсов одновременно, позволяя комбинировать изображения, видео и аудио для контроля над внешностью, движением и композицией. Генерация происходит единым 30-секундным дублем без скрытых склеек, при этом звук и видеоряд создаются совместно в одном латентном пространстве, что делает аудио полноценным сигналом для тайминга происходящего на экране.
Взаимодействие с API построено на позиционном цитировании. Разработчики передают массивы ссылок на медиафайлы, а в текстовом промпте ссылаются на них через теги формата [Image1] или [Video1]. Этот подход позволяет в одном запросе описать замену объекта, перенос движений или изменение стиля, при этом параметры duration и aspect_ratio могут вычисляться моделью автоматически на основе загруженных исходников. Для интеграции используется клиент @fal-ai/client, поддерживающий асинхронную обработку очередей, поскольку запросы с видеореференсами требуют наибольшего времени вычислений.
Стоимость использования модели напрямую зависит от выбранного провайдера. На платформе fal тарификация базируется на токенах: секунда видео в 720p обойдется примерно в $0.473, что составляет около $14.19 за 30-секундный ролик. При загрузке видеореференсов применяется понижающий коэффициент 0.6, однако биллинг учитывает длительность как выходного, так и исходного видео. При этом базовая тарификация самой ByteDance составляет около $10.37 за миллион токенов, а альтернативные агрегаторы вроде Atlas Cloud предлагают ставки от $0.134 за секунду. Подобный разброс цен делает выбор инфраструктуры определяющим фактором при масштабировании генеративных видеопродуктов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад