В последних релизах языковых моделей появились настройки вычислительных усилий. Себастьян Рашка объясняет, как LLM учатся контролировать глубину анализа задач. Рассуждение нейросети — это генерация промежуточного текстового следа. Алгоритм пошагово прорабатывает проблему перед выдачей финального ответа. Управление этим процессом происходит за счет масштабирования инференса.
Навык формируется через обучение с подкреплением и проверяемыми наградами (RLVR). Система выдает бинарный сигнал — 0 за ошибку и 1 за успех. Проверка работает в строгих доменах. Код прогоняется через компилятор, математика — через символьные решатели. Промежуточные шаги алгоритма при этом игнорируются. Награду определяет исключительно итоговый результат и формат вывода.
Обучения на финальных ответах оказалось достаточно для сложного поведения. Модель учится писать развернутые объяснения, откатываться на шаг назад и исправлять ошибки. В процессе возникают «Aha-моменты» — нейросеть замечает логическую нестыковку и корректирует ход решения. Проект DeepSeek-R1-Zero доказал работоспособность подхода. Способность к рассуждению формируется на чистом RL даже без предварительного supervised fine-tuning.
Поделиться:
Как Claude Fable 5 опровергла гипотезу Якобиана и почему это не делает ИИ математиком
Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0