Математика квантования LLM: как алгоритмы сжатия обходят проблему аномальных выбросов в тензорах

Развертывание моделей на 70B параметров в базовом формате FP16 требует около 140 ГБ видеопамяти. Переход на 4-bit сжимает веса до 35 ГБ, позволяя уместить LLM на одной серверной или топовой потребительской видеокарте. Проблема в том, что прямолинейное округление значений здесь приводит к фатальной деградации. Примерно 0,1% скрытых размерностей нейросетей содержат аномальные активации, которые превосходят остальные в десятки раз и полностью ломают сетку квантования при агрессивном сжатии.
В свежем исследовании на arXiv систематизирован математический аппарат, позволяющий обходить проблему таких выбросов. Авторы собрали подробный срез актуальных алгоритмов квантования, детально разобрав, как именно современные методы изолируют аномальные значения тензоров и применяют динамическое масштабирование для сохранения математической точности.
Работа будет полезна инженерам, которым необходимо перенести тяжелые трансформеры на встроенные системы или железо с жесткими ограничениями по VRAM. Документ функционирует как технический справочник: от фундаментальной теории дискретизации до конкретных алгоритмов и метрик производительности, показывающих пределы сжатия без потери связности генерации.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад