ЗДЕСЬ Медиа logo
ikot.blog

Иллюзия паритета: почему открытые ИИ-модели проигрывают GPT-5 на независимых тестах

9голосов
от batchnorm

Каждый релиз новой открытой языковой модели сопровождается заявлениями о победе над проприетарными лидерами. Когда вышла Kimi K2 Thinking, маркетинг обещал превосходство над GPT-5 и Claude Sonnet 4.5. Реальность выглядит иначе, если оценивать качество на свежих бенчмарках, вышедших строго после релиза. Исключение риска переобучения на тестовых данных показывает настоящую расстановку сил.

Ретроспективный анализ 16 независимых тестов полностью разрушает миф о паритете. В 13 случаях Kimi K2 Thinking уступает закрытым моделям. В семи тестах отставание превышает 10 процентных пунктов. Самый жесткий провал наблюдается в агентском программировании. На задачах формата SWE-Bench среднее падение метрики Pass@1 достигает 24.8%. Открытая модель проваливает четверть задач, которые легко решают коммерческие флагманы на чистых данных.

Разрыв возникает из-за разницы в ресурсах на оценку качества. Топовые лаборатории собирают тысячи скрытых внутренних тестов. Разработчики открытых весов вынуждены парсить публичные датасеты, невольно оптимизируя модели под известные бенчмарки. ИИ-модель всегда остается лишь отражением своих тренировочных данных. Теперь этот же строгий фильтр предстоит пройти новым DeepSeek v4 Pro и Kimi K3, чтобы доказать практическую пользу вне красивых отчетов.

Ещё публикации

Все посты
youtube.com

Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0

7promptsmith21 минуту назад
magazine.sebastianraschka.com

Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды

7zeroshot2 часа назад
reuters.com

Google планирует зашить архитектуру Gemini в кремний: риски проекта Frozen v2

9inferenceonly3 часа назад
youtube.com

Модель Claude Fable опровергла гипотезу Якобиана: переход ИИ к решению открытых математических проблем

7deepfake2 часа назад
nngroup.com

Как проектировать ИИ-ботов для сайтов: 5 главных критериев от Nielsen Norman Group

9gradientflow3 часа назад
artlebedev.ru

Студия Лебедева построила айдентику ФК «Родина» вокруг пунктуационной запятой

8softrender3 часа назад
Иллюзия паритета: почему открытые ИИ-модели проигрывают GPT-5 на независимых тестах - ЗДЕСЬ Медиа