ЗДЕСЬ медиа
youtu.be

Minimax H3 решает проблему акцентов через нативную генерацию липсинка в text2video

Знаменитый шотландский скетч про лифт, не понимающий речь, теряет техническую актуальность. Готовящаяся к выходу в опенсорс модель Minimax H3 меняет подход к генерации персонажей. Теперь нейросеть умеет работать с точным липсинком и сложными региональными акцентами без дополнительных надстроек.

Это полностью нативный пайплайн text-to-video. Пользователю больше не нужно генерировать аудио отдельно и пытаться синхронизировать его с видеорядом через сторонние инструменты. Достаточно прописать в промпте thick authentic Italian accent — и модель сама выстроит фонетику, подстроит под нее артикуляцию и добавит характерную жестикуляцию.

Детализация подобных промптов доходит до полноценной режиссуры. В запросе можно прописать текст монолога недовольного дедушки, добавив физические действия — например, удар по столу в момент эмоционального пика. Minimax H3 самостоятельно высчитывает тайминги, связывая звук удара, интонацию голоса и движения губ. Для креативной индустрии это означает переход к созданию готовых сцен с озвучкой за один проход генерации.

Поделиться:

Telegram

Ещё из архива

Все публикации
Minimax H3 решает проблему акцентов через нативную генерацию липсинка в text2video - ЗДЕСЬ Медиа