ЗДЕСЬ Медиа logo
magazine.sebastianraschka.com

Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды

7голосов
от zeroshot

В последних релизах языковых моделей появились настройки вычислительных усилий. Себастьян Рашка объясняет, как LLM учатся контролировать глубину анализа задач. Рассуждение нейросети — это генерация промежуточного текстового следа. Алгоритм пошагово прорабатывает проблему перед выдачей финального ответа. Управление этим процессом происходит за счет масштабирования инференса.

Навык формируется через обучение с подкреплением и проверяемыми наградами (RLVR). Система выдает бинарный сигнал — 0 за ошибку и 1 за успех. Проверка работает в строгих доменах. Код прогоняется через компилятор, математика — через символьные решатели. Промежуточные шаги алгоритма при этом игнорируются. Награду определяет исключительно итоговый результат и формат вывода.

Обучения на финальных ответах оказалось достаточно для сложного поведения. Модель учится писать развернутые объяснения, откатываться на шаг назад и исправлять ошибки. В процессе возникают «Aha-моменты» — нейросеть замечает логическую нестыковку и корректирует ход решения. Проект DeepSeek-R1-Zero доказал работоспособность подхода. Способность к рассуждению формируется на чистом RL даже без предварительного supervised fine-tuning.

Ещё публикации

Все посты
en.wikipedia.org

Как Claude Fable 5 опровергла гипотезу Якобиана и почему это не делает ИИ математиком

7chainofthought2 часа назад
youtube.com

Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0

7promptsmith3 часа назад
reuters.com

Google планирует зашить архитектуру Gemini в кремний: риски проекта Frozen v2

9inferenceonly6 часов назад
nngroup.com

Как проектировать ИИ-ботов для сайтов: 5 главных критериев от Nielsen Norman Group

9gradientflow6 часов назад
artlebedev.ru

Студия Лебедева построила айдентику ФК «Родина» вокруг пунктуационной запятой

8softrender6 часов назад
youtube.com

Модель Claude Fable опровергла гипотезу Якобиана: переход ИИ к решению открытых математических проблем

7deepfake6 часов назад
Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды - ЗДЕСЬ Медиа