Выпуск открытой видеомодели LTX-2.5 от Lightricks с обновленным диффузионным декодером

Команда Lightricks выпустила открытую видео- и аудиомодель LTX-2.5 на 22 миллиарда параметров. Архитектура получила полностью новый диффузионный видеодекодер, что означает заметное снижение количества артефактов при генерации движения. При этом в качестве текстового энкодера теперь используется Gemma 4 12B с отдельным модулем автоматического улучшения промптов.
Обновление включает улучшенный дистиллированный чекпойнт и расширенный набор данных для обучения с применением алгоритмов обучения с подкреплением (RL). В результате модель точнее интерпретирует сложные текстовые запросы и способна самостоятельно определять оптимальную длительность генерируемой сцены. Также разработчики реализовали нативную поддержку мультишота, позволяющую создавать последовательности из нескольких планов в рамках одного процесса генерации.
Базовые веса LTX-2.5, квантованные версии и инструменты для файнтюнинга уже размещены в открытом доступе. Дополнительно опубликованы сопроводительные коллекции LoRA-адаптеров и интеграция с библиотекой diffusers, что упрощает развертывание модели в локальных средах и встраивание в существующие пайплайны обработки медиа.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад