Flash, Lite, Pro, Ultra, Mini: как читать названия ИИ-моделей и не переплачивать
Gemini Flash и Flash-Lite, GPT Sol, Terra и Luna, Claude Opus, Sonnet и Haiku, Mistral Large, Medium и Small. Названий десятки, и кажется, что в них нет системы. Система есть — и она одна на всех.
Три яруса, которые есть у каждого
Почти каждая линейка устроена одинаково: флагман — середина — эконом. Названия разные, логика общая.
| Ярус | Anthropic | OpenAI | Mistral | Смысл | |
|---|---|---|---|---|---|
| Флагман | Pro / Ultra | Opus | Sol | Large | Максимум качества, максимум цены |
| Середина | Flash | Sonnet | Terra | Medium | Баланс: основная рабочая модель |
| Эконом | Flash-Lite | Haiku | Luna | Small | Массовые простые задачи |
Оговорка сразу: соответствие грубое. Terra и Luna из линейки GPT-5.6 — специализированные модели, а не просто «середина и эконом»; Flash у Google по скорости обгоняет флагманов. Но для первого чтения названий таблица работает.
Что реально отличает ярусы
Не «ум» в бытовом смысле. На простом вопросе все три яруса ответят одинаково. Разница проявляется на сложном: многошаговые рассуждения, длинные документы, запутанный код, редкие темы.
Цена — в разы, а не в проценты. Между соседними ярусами разница обычно 3–10 раз за токен. Между флагманом и экономом — до 30–50 раз. Это главная причина разобраться в названиях: неправильный выбор яруса умножает счёт, а не прибавляет к нему.
Скорость — обратна качеству. Эконом отвечает быстрее флагмана: меньше модель — быстрее генерация. Если ответ нужен мгновенно, дорогая модель может быть буквально хуже.
Главная ошибка: «возьму лучшую»
Интуиция говорит: раз флагман умнее, беру его — хуже не будет. Будет, и вот почему.
Переплата на ровном месте. Основная масса реальных задач — переформулировать, извлечь, классифицировать, суммаризовать, ответить по документу — целиком закрывается средним ярусом. Флагман сделает то же самое, но в 5 раз дороже и медленнее.
Ожидание. Флагманы думают дольше. В чате это раздражает, в продукте с потоком пользователей — становится проблемой.
Рабочее правило: начинайте со среднего яруса. Поднимайтесь на флагман, только когда середина ощутимо не справляется — и вы можете сказать, в чём именно. Спускайтесь на эконом, когда задача однотипная и массовая.
Суффиксы, которые стоит знать
Помимо ярусов, в названиях встречаются модификаторы:
- Lite / Mini / Nano — урезанная версия ещё ниже эконом-яруса. Для классификации и коротких ответов.
- Turbo / Fast — ускоренный вариант той же модели, часто с тем же качеством.
- Числа версий (3.5 → 3.6) — обновление в пределах поколения. Обычно означает оптимизацию, а не скачок: свежий Gemini 3.6 Flash отличается от 3.5 экономией токенов, а не новым уровнем ума.
- Специализация (Cyber, Code, Vision) — модель под конкретный класс задач. Вне своей специализации не лучше обычной.
- Preview / Experimental — черновик: может измениться или исчезнуть. В продукт не ставить.
Как ярусы выглядят в деньгах
Условный пример по мотивам реальных прайсов: обработка 1 000 запросов по паре страниц текста каждый.
| Ярус | Порядок расходов |
|---|---|
| Эконом | единицы долларов |
| Середина | десятки долларов |
| Флагман | до пары сотен долларов |
Числа условные — прайсы меняются, — но соотношение стабильно годами: каждый ярус вверх умножает счёт в разы. Прикинуть под свои объёмы можно в калькуляторе стоимости, а подобрать ярус под задачу — в подборщике модели.
Практические правила
- Не выбирайте модель по названию компании. Внутри каждой линейки есть все три яруса; вопрос не «чей ИИ лучше», а «какой ярус нужен задаче».
- Начинайте с середины, двигайтесь по результатам.
- Для массовых однотипных задач берите эконом и проверьте качество на выборке — чаще всего его хватает.
- Флагман — для задач, где ошибка дорога: юридический разбор, сложный код, ответственные тексты.
- Числовое обновление (3.5 → 3.6) берите не думая — это почти всегда та же модель дешевле или быстрее.
- Preview-версии не для продакшена. Исчезают без предупреждения.
Что стоит за словами «модель думает» и почему флагманы медленнее — в разборе рассуждающих моделей. Сколько пользователь реально ждёт ответа при разной скорости — в калькуляторе задержки.