Автоматизация ИИ-исследований: как агент Kimi K3 и Tinker проверили статью о превосходстве RLSD над GRPO

Автоматизация исследовательского цикла дошла до уровня, когда нейросети сами проверяют научные публикации. Связка агента Kimi K3 и платформы Tinker берет на себя почти весь рутинный процесс. Поскольку Tinker прячет под капот сложную инфраструктуру для обучения, агент фокусируется исключительно на логике эксперимента. Код получается чистым, а отслеживать изменения между итерациями становится намного проще.
В качестве проверки Kimi поручили воспроизвести результаты статьи о Self-Distilled RLVR (RLSD). Авторы исследования заявляли, что их метод обходит алгоритм GRPO в точности математических рассуждений. Агент с первого раза собрал базовую реализацию, после чего автономно провел 19 экспериментов с шестью конфигурациями. В качестве полигона использовались модели семейства Qwen и бенчмарк MATH500, а все обучение шло через LoRA.
Главное утверждение статьи не подтвердилось. Классический GRPO уверенно обошел RLSD, показав прирост +10.8 баллов против +9.0. Однако Kimi успешно валидировал механические свойства алгоритма: энтропия RLSD действительно остается в два раза выше на поздних этапах, а более старый метод распределенной дистилляции предсказуемо коллапсирует. ИИ не просто прогнал скрипты, но и собрал структурированный отчет с анализом метрик. Способность машин так глубоко и автономно аудировать чужие исследования впечатляет не меньше самих цифр!
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад