ЗДЕСЬ медиа
arxiv.org

Skaling law: как исследователи из Meta починили законы масштабирования языковых моделей

Это самое изящное исправление законов масштабирования нейросетей за долгое время. Исторически разработчики языковых моделей предполагали, что размер архитектуры и объем тренировочных данных влияют на финальную ошибку независимо друг от друга. На практике это приводило к систематическим погрешностям на крайних полюсах — когда данных критически мало или когда модель намеренно переобучают. Исследователи из Meta нашли способ починить эту математику.

В свежей работе авторы представили Skaling law — обновленную формулу, которая связывает емкость модели и размер датасета через единый параметр взаимодействия. Добавление всего одного связующего компонента снижает среднюю абсолютную процентную ошибку в 1,5–3 раза. Метод одинаково хорошо показывает себя как при интерполяции внутри известных значений, так и при прогнозировании за их пределами.

Для индустрии это означает колоссальную экономию вычислительных ресурсов! В связке с правильной стратегией тестирования новый закон позволяет точно предсказывать поведение будущих гигантов, затрачивая на предварительные тесты в 10 раз меньше вычислений. Теперь инженеры могут уверенно распределять огромные бюджеты на обучение новых архитектур, опираясь на результаты недорогих локальных экспериментов.

Поделиться:

Telegram

Ещё из архива

Все публикации