Wan Streamer v0.2: реалтаймовые AI-аватары в разрешении 640×368 с задержкой 200 мс

Это самое элегантное масштабирование архитектуры для потоковой генерации за последнее время. Разработчики из Alibaba выкатили Wan Streamer v0.2 — модель для двустороннего общения с AI-аватарами, которая теперь выдает картинку 640×368 при 25 fps. При этом алгоритм сохранил строгий бюджет времени: задержка на стороне модели составляет всего 200 мс. Текст, аудио и видео по-прежнему обрабатываются одним трансформером на единой причинно-следственной шкале.
Увеличение разрешения позволило выйти за рамки классических крупных планов в стиле видеозвонка. Теперь модель генерирует полноценные средние планы с привязкой к окружению. Мимика, направление взгляда, жесты рук и детали самой сцены остаются четко различимыми во время разговора. Система реагирует на текстовый промпт и переходит к живому интерактиву всего за полсекунды.
Секрет такой производительности кроется в хитром разделении вычислений при деплое. Единый трансформер разбивают на пайплайн из двух блоков: thinker и performer. Первый работает на одном GPU и отвечает за восприятие, обновление состояния и быстрое декодирование. Второй забирает на себя тяжелую генерацию визуальных латентов, используя контекстный параллелизм в стиле Ulysses на кластере видеокарт. Короткие аудио-токены обрабатываются без шардинга, что позволяет всему конвейеру работать без просадок кадров!
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад