Lift4D: пайплайн для реконструкции деформируемых 4D-ассетов по одному видео

Исследователи из университета Карнеги-Меллона открыли код Lift4D — фреймворка, который собирает полноценный анимированный 3D-ассет из обычного плоского видео. В отличие от стандартной фотограмметрии или NeRF, пайплайн переваривает динамичные сцены с нежесткими деформациями и логически достраивает невидимые ракурсы на 360 градусов. Технология работает с роликами, снятыми в естественных условиях, без необходимости в сложной калибровке камер.
В основе инструмента лежит трехступенчатая архитектура, объединяющая несколько ресурсоемких моделей. На первом этапе SAM 3 сегментирует нужный объект по текстовому промпту. Затем в дело вступает Causal SAM3D, генерирующий покадровую 3D-реконструкцию с учетом карт глубины от Depth Anything 3. На финальном этапе алгоритм сливает разрозненные кадры в единую каноническую форму, используя оптимизацию на базе 3D-гауссианов и Stable Zero123 для сохранения визуальной согласованности между ракурсами.
Пока решение остается сугубо исследовательским и требует специфического железа: авторы заявляют о тестировании на видеокартах класса A100 с 40 ГБ памяти. Сборка пайплайна также потребует ручной настройки окружения и авторизации для загрузки закрытых весов. Несмотря на высокий порог входа, проект наглядно показывает, как автоматизируется извлечение сложных пространственных данных и анимаций из обычного пользовательского контента.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад