Генерация длинных треков с вокалом: локальная модель MiniMax Music 3 в ComfyUI

В ComfyUI появилась нативная поддержка MiniMax Music 3 — модели для локальной генерации аудио. Она создает треки длиной до пяти минут с вокалом и четкой структурой. За глобальную логику композиции отвечает LLM на 8B параметров. Акустические детали обрабатывает локальная модель на 0.6B. Синтез звука идет через архитектуру Flow Matching и Flow-VAE. На выходе получается стерео с частотой 32 кГц и глубиной 16 бит.
Официальный воркфлоу принимает два текстовых инпута. Поле Caption задает жанр, темп, тональность, характер вокала и инструменты. Во второе поле загружается текст песни со структурными тегами. Разметка вида [Intro], [Verse] или [Chorus] работает как прямая инструкция для смены частей трека. Для видеокарт с небольшим объемом памяти добавлена функция tiled_decode. Она декодирует аудио тайлами, снижая потребление VRAM при работе с длинными композициями.
Адаптированные веса лежат в репозитории Comfy-Org на Hugging Face. Сам шаблон доступен через раздел Template Library напрямую в интерфейсе ComfyUI. В нише открытых решений MiniMax сейчас обходит модель ACE, но пока уступает коммерческой Suno. Для упрощения работы авторы также выложили скрипт, который конвертирует короткие описания в правильный многоуровневый промпт.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад