Бенчмарк MirrorCode: оценка автономного программирования на длинных дистанциях

Синтетические тесты для нейросетей устаревают быстрее сроков их разработки. Алгоритмические задачи вроде олимпиадного программирования больше не показатель. Их уверенно решают даже открытые локальные модели. Теперь главной метрикой становится автономность. Важно понять, способна ли нейросеть писать код сутками без вмешательства человека.
Команды Epoch AI и METR выпустили бенчмарк MirrorCode. Он оценивает длинные горизонты планирования при разработке. Задача модели — полностью воссоздать программу без исходного кода. Нейросеть помещают в изолированную среду без доступа в интернет. Сгенерированный код проверяют скрытыми end-to-end тестами. Вывод должен полностью совпадать с оригиналом.
Бюджет на инференс в MirrorCode не ограничен. Самая длинная тестовая сессия заняла 19 дней автономной работы и стоила $2600. Показательный пример — переписывание биоинформатической утилиты gotree. Это 16 000 строк кода на языке Go. Модель Claude Opus 4.7 справилась с задачей за 14 часов. Затраты на API составили $251. Обычному разработчику на это потребовалось бы от двух до семнадцати недель.
Текущий предел бенчмарка далек от ста процентов. Рекорд держится на отметке 56%. Зачастую стопроцентному прохождению тестов мешают ошибки в специфичных краевых случаях. Инфраструктура тестирования и 22 проекта выложены в открытый доступ.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад