Как читать бенчмарки нейросетей и не покупаться на «обошла всех»
Выходит новая модель — и в анонсе обязательно график: столбик новинки выше всех остальных. Через неделю выходит конкурент — и уже его столбик выше. Разбираемся, что стоит за этими цифрами и как читать их, чтобы не выбрать модель по красивой картинке.
Главные бенчмарки и что они меряют
| Тест | Что проверяет | Чему НЕ равен |
|---|---|---|
| MMLU | Эрудиция: 57 предметов, вопросы с вариантами ответа | Умению рассуждать |
| SWE-Bench | Решение реальных задач с GitHub: починить баг в репозитории | Умению писать код с нуля |
| AIME / MATH | Олимпиадная математика | Обычной арифметике в вашей таблице |
| HumanEval | Написание небольших функций по описанию | Работе в большом проекте |
| GPQA | Вопросы уровня аспирантуры (физика, химия, биология) | Практической пользе |
| Terminal-Bench | Работа в командной строке: планирование, инструменты | Диалогу с человеком |
| LMArena | Живые люди сравнивают ответы вслепую | Объективной точности |
Обратите внимание на правую колонку — это самое важное. Высокий MMLU не значит, что модель хорошо рассуждает. Высокий HumanEval не значит, что она справится с вашим проектом на 50 файлов.
Почему цифрам нельзя верить буквально
Четыре причины, и все они серьёзные.
1. Загрязнение данных (contamination). Тесты лежат в открытом доступе годами. Если задачи попали в обучающую выборку, модель их помнит, а не решает. Разработчики борются с этим, но полностью исключить невозможно — отсюда постоянные обновления тестов вроде «AIME 2025» вместо «AIME 2024».
2. Тренировка под тест. Когда индустрия договорилась мерить успех по SWE-Bench, у всех появился стимул оптимизировать именно под него. Это классический эффект: как только метрика становится целью, она перестаёт быть хорошей метрикой.
3. Разные условия замера. Одну и ту же модель можно прогнать с разными настройками: с рассуждением и без, с несколькими попытками и с одной, с подсказками в промпте и без. Разброс легко достигает десятка процентов. В анонсах обычно показывают лучший из возможных прогонов — и это не обман, но и не то, что вы получите по умолчанию.
4. Разница в пару процентов — это шум. Модель с 88,4% против модели с 87,9% — на практике неразличимы. А в графике анонса разница выглядит убедительной, потому что ось Y начинается не с нуля.
На что смотреть вместо цифр
Практический подход, который работает лучше любого лидерборда:
- LMArena (бывшая Chatbot Arena) — здесь живые люди вслепую сравнивают ответы двух моделей. Это не измеряет точность, зато измеряет то, ради чего вы моделью и пользуетесь: насколько ответ полезен человеку. Манипулировать этим сложнее.
- Тест на своих задачах. Возьмите 10–20 своих реальных запросов — тех, что вы правда решаете каждый день, — и прогоните через кандидатов. Полчаса работы дадут больше, чем неделя чтения лидербордов.
- Смотрите на профиль, а не на среднее. Одна модель сильна в коде, другая в длинных текстах, третья в языках. «Лучшая вообще» не существует — существует лучшая под вашу задачу.
- Цена и лимиты часто важнее качества. Модель на 3% умнее, но втрое дороже — плохая сделка для большинства сценариев. Посчитать можно калькулятором стоимости API.
Что делать с заявлениями вроде «обошла GPT и Claude»
Три вопроса, которые снимают почти все сомнения:
- На каком тесте? Если победа только на одном узком бенчмарке — это не «обошла вообще», это «обошла в этом».
- В каких условиях? Сравнивали с рассуждением против без рассуждения? С разным числом попыток?
- Кто мерил? Замер самого разработчика и независимая проверка — разные вещи. Ждите независимых прогонов, они появляются через несколько дней.
Хороший признак честности — когда компания сама называет свои слабые места. Например, Thinking Machines при выпуске Inkling прямо написала, что модель не самая сильная на рынке. Такому анонсу можно доверять больше, чем графику, где всё зелёное.
Что запомнить
- Каждый бенчмарк меряет что-то узкое — и не меряет всё остальное.
- Загрязнение данных и тренировка под тест делают абсолютные цифры условными.
- Разница в 1–3% — это шум, а не преимущество.
- LMArena ближе к реальной пользе, чем академические тесты.
- Ваши 20 задач информативнее любого лидерборда.
- Спрашивайте: на каком тесте, в каких условиях, кто мерил.
Как выбрать модель под конкретную задачу — в гайде как выбрать модель. Сравнить характеристики и цены популярных моделей можно в нашем разделе сравнений, а посчитать расходы — калькулятором API.