Адаптация MiniMax-H3 Turbo LoRA для ComfyUI: генерация видео и аудио за четыре шага с ускорением в пять раз

На платформе Hugging Face опубликована адаптированная версия весов MiniMax-H3 Turbo LoRA, предназначенная для работы в среде ComfyUI. Исходный проект, разработанный автором под псевдонимом larryvrh, представляет собой метод дистилляции, который сокращает процесс совместной генерации видео и синхронизированного стереозвука со стандартных двадцати до четырех шагов, что обеспечивает пятикратное сокращение времени рендеринга.
Оригинальные веса Turbo LoRA требовали изменения ключей тензоров, поскольку встроенный загрузчик ComfyUI использует собственное пространство имен. В представленной конверсии ключи вида blocks.* были преобразованы в diffusion_model.blocks.*, при этом сохранились исходные значения тензоров, формат BF16 и архитектурная совместимость с усеченным чекпоинтом MiniMax-H3. Из адаптера удалены 102 тензора проекции AdaLN, несовместимые с усеченной моделью, однако полностью сохранены адаптеры внимания и многослойных перцептронов основного блока, а также модули уточнения токенов.
Репозиторий включает несколько версий файлов, в том числе базовые превью-варианты и дополнительно обученные чекпоинты на 500 шагов, разделенные на EMA и non-EMA версии. Варианты без экспоненциального скользящего среднего (non-EMA) сохраняют более высокую детализацию и лучше обрабатывают быстрые движения, в то время как EMA-версии формируют более сглаженный результат за счет усреднения весов во времени. Конверсия тестировалась с дополнительными методами акселерации внимания, такими как SageAttention и Sol Attention, что позволяет варьировать стратегии оптимизации памяти при работе с тяжелыми графами генерации.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад