Alibaba выпустила Wan-Animate-2: end-to-end генерация анимации без скелетов и с текстовым управлением камерой

Это самая изящная реализация переноса движений за последнее время. Команда Alibaba выкатила открытую модель Wan-Animate-2, и старый подход с жестким pose-control официально устарел. Архитектура напрямую передает управляющее видео в переработанный Diffusion Transformer. Промежуточные костыли в виде экстракторов скелетов больше не нужны. Нейросеть сама считывает мимику, физику одежды и сложную моторику рук.
Главный технический сдвиг — полная отвязка ракурса генерации от исходного ролика. Вы можете взять референс, снятый строго в анфас, и через текстовый запрос заставить виртуальную камеру облететь персонажа сбоку или сверху. Само движение при этом не ломается! По логике работы это прямой конкурент SCAIL-2, но акценты расставлены иначе. Если SCAIL-2 лучше справляется с многофигурными сценами, то Wan-Animate-2 выигрывает именно в чистом копировании пластики и свободе операторской работы.
Разработчики сразу опубликовали скрипты инференса и веса базовой модели на 14B параметров. Для тех, кому важна скорость, есть дистиллированная версия Wan-Animate-2-Lite. Она требует всего 10 шагов генерации, что вплотную приближает процесс к реалтайму и открывает дорогу для стриминга интерактивных персонажей. Инструмент уже получил нативную поддержку в библиотеке diffusers, поэтому локальный запуск требует минимума усилий.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад