GGUF-квантизации Tencent Hy3: запуск MoE-модели на 295B параметров с MTP-декодированием

Tencent выпустила Hy3 — MoE-модель на 295 млрд параметров, заточенную под кодинг и агентные задачи. При инференсе активен всего 21 млрд параметров. Это делает запуск дешевым по сравнению с монолитными моделями. Контекстное окно вмещает 256K токенов. По качеству кода и логики архитектура обходит GLM-5.1, хотя последняя в 2,5 раза больше. Лицензия Apache 2.0 позволяет использовать веса в коммерческих проектах.
На Hugging Face появились GGUF-квантизации Hy3. Сборка использует матрицу важности (imatrix), откалиброванную на датасетах с кодом и чатами. Доступны версии от Q8_0 весом 318 ГБ для серверов до сжатой IQ1_M на 92 ГБ. Для запуска пока требуется собрать форк llama.cpp с PR #25364. При инициализации сервера или чата обязательно нужен флаг --jinja, иначе шаблонизатор выдаст ошибку.
Главная техническая деталь релиза — поддержка спекулятивного декодирования MTP. В низкобитных квантизациях слой MTP намеренно оставлен в формате q8_0. Это сохраняет качество генерации черновиков. На тестах квантизация IQ2_M выдает 18 токенов в секунду. Включение флага --spec-type draft-mtp разгоняет генерацию до 22.8 токенов — чистый прирост скорости на 27% при 90% принятых токенов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад