NVIDIA представила архитектуру TwoTower: гибрид диффузии и авторегрессии, ускоряющий генерацию текста в 2.4 раза

NVIDIA опубликовала спецификации и веса Nemotron-Labs-TwoTower-30B — гибридной языковой модели, которая решает классический архитектурный компромисс современных LLM. Стандартные авторегрессионные сети вроде GPT выдают высокое качество, но работают медленно из-за посимвольной генерации. Диффузионные языковые модели предсказывают целые блоки текста параллельно, но до сих пор это приводило к сильной деградации ответов. NVIDIA обошла это ограничение, разделив процесс на две параллельные нейросети.
Архитектура базируется на 52-слойном гибриде механизмов внимания, Mamba-2 и MoE. Первая башня, Context tower, полностью заморожена: она работает как классическая авторегрессия, считывая чистый промпт и формируя KV-кэш. Вторая, обучаемая Denoiser tower, отвечает за саму генерацию с помощью масочной диффузии. Она обрабатывает шумные блоки по 16 токенов за раз (block_size = 16), кросс-вниманием опираясь на кэш из первой башни. На каждом шаге алгоритм confidence unmasking фиксирует только те токены, в которых сеть уверена, а оставшиеся позиции отправляет на повторную очистку от шума.
Такой пайплайн позволил сохранить 98.7% качества базовой авторегрессионной модели на ключевых бенчмарках, включая MMLU, ARC-Challenge и HumanEval. При этом реальная пропускная способность вывода (wall-clock throughput) выросла в 2.42 раза. Модель дообучена на корпусе в 2.1 триллиона токенов и уже доступна для коммерческого использования, предлагая новый подход для высоконагруженных AI-агентов, где критична скорость отклика без потери сложной логики.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад