ЗДЕСЬ медиа
vllm.ai

Выход открытых весов Qwen3.8-2.4T-A95B и интеграция модели в vLLM

Состоялся релиз открытых весов модели Qwen3.8-2.4T-A95B, которая сразу получила поддержку в движке вывода vLLM. Это гибридная MoE-нейросеть на 2.4 триллиона параметров, из которых при каждом запросе активируются 95 миллиардов. Архитектура состоит из 92 слоев, где механизм полного внимания применяется только на каждом четвертом слое, а остальные используют линейное внимание, что определяет специфику распределения вычислительной нагрузки. Оригинальные веса в формате BF16 занимают около пяти терабайт дискового пространства.

Для снижения требований к оборудованию сторонние разработчики подготовили квантованные версии модели в форматах NVFP4 и MXFP4. Использование четырехбитного квантования позволяет развернуть нейросеть на одной серверной ноде с ускорителями архитектуры NVIDIA B300 или AMD MI355X, тогда как запуск базовой версии требует минимум двух таких узлов. Разработчики оборудования совместно с авторами фреймворка интегрировали оптимизированные ядра для обработки плотных матриц и маршрутизации экспертов, минимизируя задержки при передаче данных между GPU.

Практическое применение модели демонстрирует стабильные результаты в задачах сложного логического вывода и анализа визуальных данных. Поскольку архитектура изначально спроектирована с упором на длительные рассуждения, для корректной работы агентов на базе Qwen 3.8 требуется выделять увеличенный бюджет токенов, устанавливая высокие значения параметра max_tokens в конфигурации инференса.

Поделиться:

Telegram

Ещё из архива

Все публикации