ЗДЕСЬ медиа
huggingface.co

Выпуск открытой видеомодели LTX-2.5 от Lightricks с обновленным диффузионным декодером

Команда Lightricks выпустила открытую видео- и аудиомодель LTX-2.5 на 22 миллиарда параметров. Архитектура получила полностью новый диффузионный видеодекодер, что означает заметное снижение количества артефактов при генерации движения. При этом в качестве текстового энкодера теперь используется Gemma 4 12B с отдельным модулем автоматического улучшения промптов.

Обновление включает улучшенный дистиллированный чекпойнт и расширенный набор данных для обучения с применением алгоритмов обучения с подкреплением (RL). В результате модель точнее интерпретирует сложные текстовые запросы и способна самостоятельно определять оптимальную длительность генерируемой сцены. Также разработчики реализовали нативную поддержку мультишота, позволяющую создавать последовательности из нескольких планов в рамках одного процесса генерации.

Базовые веса LTX-2.5, квантованные версии и инструменты для файнтюнинга уже размещены в открытом доступе. Дополнительно опубликованы сопроводительные коллекции LoRA-адаптеров и интеграция с библиотекой diffusers, что упрощает развертывание модели в локальных средах и встраивание в существующие пайплайны обработки медиа.

Поделиться:

Telegram

Ещё из архива

Все публикации