AsymFlow: генерация напрямую в пикселях без VAE и ускорение FLUX.2 klein на 40%

Архитектура AsymFlow позволяет напрямую переносить обученные латентные диффузионки в пиксельное пространство. На ее базе авторы дообучили девятимиллиардную модель FLUX.2 klein. Новая версия генерирует изображения без использования VAE, что ускоряет процесс на 40% и избавляет от характерного замыливания мелких деталей.
Обычно генерация в несжатом пиксельном пространстве сжигает емкость трансформера на обработку многомерного шума. Метод использует рангово-асимметричную параметризацию: модель предсказывает шум только в низкоранговом подпространстве, а предсказание самих данных оставляет полноразмерным. Затем полная скорость генерации восстанавливается аналитически без изменения архитектуры. Это дает возможность сохранить высокоуровневую семантику оригинальной латентной сети, поэтому файнтюнинг направлен исключительно на коррекцию низкоуровневых текстур.
На бенчмарке ImageNet 256x256 архитектура выдает 1.57 FID, с запасом обходя предыдущие пиксельные DiT-модели. Дообученная AsymFLUX.2 klein также заняла первую строчку в тесте HPSv3 с результатом 10.66, обогнав свою базовую латентную версию. Исходный код уже опубликован, протестировать логику можно в демо на HuggingFace, а релиз нод для среды ComfyUI ожидается в ближайшие дни.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад