Сравнения моделей
Прямые сопоставления нейросетей с коротким вердиктом — что выбрать под задачу.
Нужен топовый кодинг при минимальной цене и большой контекст — Kimi K2.6. Нужен максимально длинный контекст (1M) и зрелый русский язык — DeepSeek V4. Обе открытые и работают в РФ.
Смотреть сравнение →Два «рабочих лошадки» среднего тира. Gemini 3.5 Flash — за скорость, огромный контекст и агентные задачи. Claude Sonnet 4.6 — за качество текста, аккуратное следование инструкциям и кодинг.
Смотреть сравнение →Нужна скорость, огромный контекст и сильная агентная работа за разумные деньги — Gemini 3.5 Flash. Нужен максимум возможностей, голос и огромная экосистема — GPT-5.5. Обоим нужен доступ из-за рубежа.
Смотреть сравнение →Нужны длинные ролики до 2 минут и доступ из РФ — Kling 3.0. Нужно максимальное качество с встроенным звуком и 4K — Google Veo 3. У Kling это решает большинство задач без VPN.
Смотреть сравнение →Нужны свежие данные из X и дерзкий стиль ответов — Grok 4. Нужен универсальный флагман с мультимодальностью и большой экосистемой — GPT-5.5. Обоим нужен доступ из-за рубежа.
Смотреть сравнение →Нужен баланс цены и качества от лидера, чёткое следование инструкциям — Claude Sonnet 4.6. Нужна работа в РФ, открытые веса и максимально дёшево/бесплатно — DeepSeek V4.
Смотреть сравнение →Нужен максимум возможностей почти бесплатно, открытые веса и работа в РФ — DeepSeek V4. Нужно топовое качество в коде и сложных задачах без оглядки на цену — Claude Opus 4.8 (но дорого и без доступа из РФ).
Смотреть сравнение →Нужен рекордный контекст и анализ больших данных, видео и аудио — Gemini 3.1 Ultra. Нужен универсальный флагман с огромной экосистемой и голосом — GPT-5.5. Обоим нужен доступ из-за рубежа.
Смотреть сравнение →Для кода и агентных задач сильнее Claude Opus 4.8. Для мультимодальности и широкой экосистемы — GPT-5. Обоим нужен доступ из-за рубежа.
Смотреть сравнение →Нужна работа в России без VPN и отличный русский язык — YandexGPT 5. Нужен максимум возможностей и мультимодальность — GPT-5.5 (но без официального доступа из РФ).
Смотреть сравнение →Обе открытые, дешёвые и работают в РФ. DeepSeek V3 — топ цена/качество и рассуждения. Qwen 3 Max — сильнее в коде, математике и многоязычности.
Смотреть сравнение →Нужен максимум возможностей за копейки и работа в РФ — DeepSeek V3. Нужен лучший русский язык и локальные реалии — YandexGPT 5.
Смотреть сравнение →Midjourney v7 — за максимальную художественность и эстетику. Imagen 4 — за фотореализм и аккуратный текст на картинках, плюс экосистема Google.
Смотреть сравнение →Нужна лучшая эстетика «из коробки» без возни — Midjourney v7. Нужны бесплатность, локальный запуск и полный контроль — Stable Diffusion.
Смотреть сравнение →Нужна эталонная эстетика и не жалко платить — Midjourney v7. Нужен удобный старт, бесплатные кредиты и готовые стили — Leonardo AI.
Смотреть сравнение →Нужна максимальная эстетика «из коробки» — Midjourney v7. Нужна открытая модель, self-hosting и работа в РФ — FLUX.2.
Смотреть сравнение →Нужен абсолютный потолок интеллекта на сложнейших задачах — Claude Fable 5. Нужно почти то же качество дешевле и быстрее (особенно для кода) — Claude Opus 4.8.
Смотреть сравнение →Живёте в Windows и Office — Microsoft Copilot уже встроен и под рукой. Нужен максимум возможностей, расширения и универсальность — ChatGPT на GPT-5.5.
Смотреть сравнение →GPT-5 — за универсальность и огромную экосистему. Gemini 3 Pro — за рекордный контекст и работу с документами и видео.
Смотреть сравнение →Нужен максимум качества и экосистема — GPT-5.5. Нужно почти то же за копейки, с открытыми весами и работой в РФ — DeepSeek V3.
Смотреть сравнение →Midjourney — за максимальную художественность. DALL·E 3 — за точное следование тексту и удобство прямо в ChatGPT.
Смотреть сравнение →Claude Sonnet 4.6 — за баланс цены и качества и сильный код. GPT-5.5 — за мультимодальность и огромную экосистему, но дороже.
Смотреть сравнение →Обе работают в России без VPN. YandexGPT чуть сильнее в текстах и локальных реалиях, GigaChat умеет ещё и генерировать картинки.
Смотреть сравнение →Cursor — за агентность и понимание всего проекта. GitHub Copilot — за зрелость и работу в любом редакторе с интеграцией GitHub.
Смотреть сравнение →Обе открытые и бесплатные. Llama — крупнейшая экосистема и поддержка. Qwen — сильнее в коде, математике и многоязычности.
Смотреть сравнение →Veo 3 — за максимальное качество и звук, но платно и недоступно в РФ. HunyuanVideo — открытая и бесплатная, работает в России, но нужно своё железо.
Смотреть сравнение →Обе доступны в России без VPN. FLUX.2 — за максимальное качество и гибкость (открытая модель). Kandinsky — за простоту и бесплатный доступ от Сбера.
Смотреть сравнение →Claude Opus 4.8 — для кода и сложных агентных задач. Gemini 3.1 Ultra (на базе Gemini 3 Pro) — для работы с гигантскими документами, видео и анализом данных с выполнением кода.
Смотреть сравнение →Claude Fable 5 — абсолютный потолок интеллекта для самых сложных задач. GPT-5 — более доступный универсал с широкой экосистемой и мультимодальностью.
Смотреть сравнение →Grok 4 — за живой стиль и доступ к свежим данным из X в реальном времени. Gemini 3 Pro (Gemini 3.1 Ultra) — за рекордный контекст, мультимодальность и точность ответов.
Смотреть сравнение →Grok Imagine — за скорость и публикацию прямо в X, оживление фото (image-to-video). Veo 3 — за максимальное качество видео и звук, но дороже и без доступа из РФ.
Смотреть сравнение →Обе открытые и с рассуждениями. Magistral — прозрачные «цепочки мыслей» и сильная многоязычность. DeepSeek V3 — топ цена/качество и популярность, чуть сильнее в коде и математике.
Смотреть сравнение →DeepSeek V4 — открытая MoE с контекстом 1M и копеечной ценой, работает в РФ и локально. GPT-5.5 — максимум возможностей и огромная экосистема, но дорого и без официального доступа из РФ.
Смотреть сравнение →Gemini 3.1 Ultra — за гигантский контекст 2M, нативную мультимодальность и выполнение кода. Claude Opus 4.8 — за лучший в классе кодинг и агентные сценарии.
Смотреть сравнение →Nano Banana Pro — за точное редактирование по референсам, читаемый текст на картинке и рассуждение над композицией. Midjourney v7 — за более выразительную, художественную эстетику «из коробки».
Смотреть сравнение →o4-mini — если нужно недорогое рассуждение с пониманием картинок в экосистеме OpenAI. Gemini 3.5 Flash — если важнее скорость, огромный контекст 1M и агентные сценарии с работой в браузере.
Смотреть сравнение →Claude Sonnet 5 — если приоритет агентные сценарии и кодинг, а также нужна модель почти уровня топ-флагмана, но дешевле. GPT-5.5 — если важнее мультимодальность (текст, картинки, голос) и огромная экосистема готовых интеграций ChatGPT.
Смотреть сравнение →GLM-5.2 — если приоритет длинные автономные задачи кодинга и нужна максимально низкая цена. Kimi K2.6 — если важна мультимодальность (текст, картинки, видео) в единой архитектуре при сопоставимом качестве.
Смотреть сравнение →Seedance 2.0 — если нужен максимум контроля: до 12 мультимодальных референсов и разрешение до 2К. HappyHorse 1.0 — если приоритет липсинк на разных языках и скорость генерации. Обе модели делят вершину рейтингов видео 2026 года — выбор больше про сценарий, чем про качество.
Смотреть сравнение →GPT-5.6 Sol — если нужен мультиагентный режим Ultra для самых сложных задач кодинга и security research, и есть доступ (пока только у превью-партнёров). Claude Opus 4.8 — если нужна стабильно доступная модель с лучшими в классе результатами в программировании прямо сейчас.
Смотреть сравнение →Grok 4.5 — если нужна доступная прямо сейчас модель с огромным контекстом (500K) и глубокой интеграцией с редактором кода Cursor по разумной цене. GPT-5.6 Sol — если нужен потолок в кодинге и мультиагентный режим Ultra, и вы попали в число превью-партнёров. По сути выбор между «доступно и мощно» и «максимально мощно, но пока для избранных».
Смотреть сравнение →Два «лёгких» тира для скорости и объёма. GPT-5.6 Luna — если вы уже в экосистеме OpenAI (ChatGPT, Codex, API) и нужен самый дешёвый вариант линейки GPT-5.6. Claude Haiku 4.5 — если важнее аккуратное следование инструкциям, качество текста и окно 200K. Обе быстрые, дешёвые и без официального доступа из РФ.
Смотреть сравнение →Claude Sonnet 5 — если нужен почти флагманский уровень для кодинга и агентных задач, но при заметно меньшей цене и высокой скорости: идеальна для массовых и потоковых сценариев. Claude Opus 4.8 — когда важен абсолютный потолок качества на самых сложных задачах и цена вторична. По сути выбор между «почти максимум дёшево» и «максимум любой ценой».
Смотреть сравнение →Две сильнейшие открытые модели с доступом из России. Qwen 3.6 — если важен локальный запуск на одной видеокарте и топовый кодинг при малом размере. DeepSeek V4 — если нужен максимально длинный контекст (1M) и зрелый русский язык. Обе бесплатны, открыты и не требуют VPN.
Смотреть сравнение →Два топовых генератора картинок 2026 года. ChatGPT Images 2.0 — если критичен идеальный текст на картинке (около 99% точности) и редкие языки, плюс встроенное «мышление» над композицией. Nano Banana Pro — если нужно сложное многошаговое редактирование с сохранением персонажей (до 14 референсов) и разрешение до 4К. Обе требуют VPN из РФ.
Смотреть сравнение →Наглядное сравнение двух подходов к генерации текста. Nemotron TwoTower — диффузионная модель: пишет текст блоками параллельно и потому быстрее, но это скорее исследовательский прорыв. Qwen 3.6 — классическая (авторегрессионная) открытая модель: зрелая, сильная в кодинге, готова к повседневной работе. Обе открытые и работают из РФ.
Смотреть сравнение →Две открытые кодинг-модели лета 2026, но разного масштаба. Kimi K2.7 Code — гигант на 1 трлн параметров для максимального качества и длинных агентных задач (запуск через провайдеров/облако). Cohere North Mini Code — компактная модель, которая влезает на одну видеокарту H100 и подходит для приватной локальной работы. Обе открытые и работают из РФ.
Смотреть сравнение →Две открытые MoE-модели среднего тира. Mistral Small 4 — «европейский» выбор: сильна в европейских языках и вопросах соответствия, распространяется открыто. Qwen 3.6 — если важнее кодинг, зрелый мультиязычный охват (включая русский) и запуск компактной 27B-версии на одной видеокарте. Обе открытые и работают из РФ.
Смотреть сравнение →Две агентные модели лета 2026. Muse Spark 1.1 — если критичен огромный контекст (1M) с самоуправлением памятью и «computer use» для сложных многошаговых задач. Claude Sonnet 5 — если нужен проверенный, стабильно доступный уровень для кодинга и агентов при меньшей цене. Обе без официального доступа из РФ.
Смотреть сравнение →Две фронтирные модели Anthropic из одного релиза — обе попали под экспортные ограничения США 12 июня и обе вернулись 1 июля 2026. Fable 5 — публичный флагман линейки с окном 1M токенов и подстраховкой через Opus 4.8 на рискованных запросах. Mythos 5 — вторая фронтирная модель того же поколения. Обе для самых сложных задач, обе без официального доступа из РФ.
Смотреть сравнение →Две открытые модели Mistral, но задачи у них разные. Medium 3.5 — плотная 128B с контекстом 262K, зрением и настраиваемой глубиной рассуждений: берите, если нужны агенты, картинки и длинные документы. Small 4 — MoE на 119B, где на токен активируется лишь ~6B: качество среднего тира при цене и скорости небольшой модели. Если бюджет и железо ограничены, Small 4 практичнее; если нужен потолок качества среди открытых — Medium 3.5.
Смотреть сравнение →Два открытых MoE-гиганта с почти одинаковым размером — но с прямо противоположной философией. GLM-5.2 бьётся за место в лидербордах и обходит GPT-5.5 на длинном кодинге. Inkling открыто заявляет, что в лидерборды не играет: это заготовка под дообучение через платформу Tinker. Нужна открытая модель, чтобы просто работать из коробки — берите GLM-5.2. Собираетесь дообучать под свою задачу — Inkling задуман ровно для этого.
Смотреть сравнение →Оба — автономные агенты: ставите цель, они сами доводят её до результата. Разница в том, откуда они растут. Cowork вырос из Claude Code и заточен под офисную рутину: ваши файлы, почта, таблицы, презентации — и он входит в подписку Claude Pro без доплаты. Manus — самостоятельный сервис, сильный в исследованиях, поиске и коде «с нуля». Если вы уже платите за Claude, Cowork — очевидный выбор без лишних трат. Если нужен агент под разовые исследовательские задачи и подписки на Claude нет — смотрите на Manus.
Смотреть сравнение →Две открытые MoE-модели, вышедшие с разницей в один день, — и это отличная иллюстрация того, что «открытая» бывает очень разной. Kimi K3 втрое крупнее и уже работает через API из РФ без VPN, но веса обещаны только с 27 июля. Inkling скачивается с Hugging Face прямо сейчас и бесплатно — но раскрывается лишь после дообучения под вашу задачу, о чём Thinking Machines честно предупреждает. Нужно просто пользоваться сегодня — берите Kimi K3. Собираетесь строить своё на открытых весах — Inkling.
Смотреть сравнение →Две открытые модели, которые реально запускаются на домашнем железе и работают из РФ без VPN, — но с разным характером. Gemma 4 от Google берёт мультимодальностью (видео, картинки, речь) и линейкой размеров от телефона до 31B под Apache 2.0. Qwen 3.6 от Alibaba сильнее в коде и заточена под запуск на одной видеокарте. Нужны картинки, звук и выбор размера под устройство — Gemma 4. Основная задача — код и текст на одной GPU — Qwen 3.6. Обе бесплатны в весах.
Смотреть сравнение →Два китайских гиганта с прямо противоположным подходом. Doubao — закрытая модель ByteDance и движок второго по популярности ИИ-приложения в мире, но заточена под внутренний рынок Китая: чтобы ей пользоваться, обычно нужен китайский номер. DeepSeek V4 — открытая, доступна из России без VPN, стоит копейки и запускается у себя. Для русскоязычного пользователя выбор в большинстве случаев очевиден: DeepSeek. Doubao интересна скорее как явление — показатель того, каких масштабов достигает ИИ внутри Китая.
Смотреть сравнение →Две закрытые китайские модели от главных техногигантов страны — Baidu и ByteDance. ERNIE 5.1 интересна экономикой: первая китайская модель в топ-5 Search Arena, обученная примерно за 6% бюджета западных флагманов. Doubao берёт масштабом: это движок второго по популярности ИИ-приложения в мире с 336 млн пользователей, и она сильнее в коде и агентных задачах. Обе почти недоступны из России: облако, китайская юрисдикция и регистрация по местному номеру. Для русскоязычного пользователя практичнее открытые китайские модели — DeepSeek или Qwen.
Смотреть сравнение →Две открытые модели NVIDIA с одинаковой фамилией, которые делают принципиально разные вещи — и это как раз тот случай, когда путаница стоит дорого. Nemotron 3 Embed ищет: превращает документы в векторы, чтобы находить нужное по смыслу. Писать текст она не умеет вообще. TwoTower наоборот — генерирует текст, причём в 2,4 раза быстрее обычных моделей за счёт диффузионного подхода. Если строите поиск по своей базе знаний или RAG — нужна первая. Если нужен быстрый генератор ответов — вторая. В полноценной RAG-системе они, по сути, работают в паре: одна находит нужные куски документов, вторая пишет по ним ответ.
Смотреть сравнение →Две китайские открытые модели-гиганта, но соревнуются они в разном. Kimi K3 берёт размером — 2,8 трлн параметров, звание крупнейшей открытой модели и универсальность с нативным зрением; Moonshot при этом сама признаёт, что до Claude Fable 5 и GPT-5.6 Sol по интеллекту не дотягивает. LongCat-2.0 меньше (1,6 трлн), но специализирована под агентное программирование и выигрывает там, где для бизнеса это важнее всего: лицензия MIT позволяет встроить её в закрытый коммерческий продукт без раскрытия своего кода. Плюс политический аргумент — обучена целиком на китайских чипах, без Nvidia. Нужен универсальный ассистент с картинками — K3. Нужен движок для кодового агента внутри своего продукта — LongCat.
Смотреть сравнение →Две открытые модели NVIDIA, которые показывают, насколько широко компания раскинула сети — и почему «модель от NVIDIA» само по себе ничего не говорит. GR00T N1.7 управляет физическим роботом: смотрит камерой, слышит команду и двигает манипулятором. Nemotron 3 Embed не двигает ничего — она превращает текст в векторы, чтобы искать по документам по смыслу. Общее у них ровно одно: обе открытые, обе рассчитаны на запуск на своём железе и обе бесполезны без обвязки. Выбирать между ними не приходится: если у вас робот — первая, если база документов — вторая.
Смотреть сравнение →Сравнение универсала со специалистом. Kling 3.0 сделает видео почти на любой сюжет по текстовому описанию — но это закрытый сервис с оплатой за генерацию. Wan-Dancer умеет ровно одно: танец под загруженную вами музыку — зато веса открыты под Apache 2.0, то есть модель можно скачать, крутить на своём железе и использовать коммерчески без отчислений. Если нужен один ролик и не хочется возиться — Kling. Если нужен поток танцевальных видео под музыку и есть GPU — Wan-Dancer окупится, потому что за генерацию вы не платите вообще. Главная неизвестная у Wan-Dancer: разработчик не опубликовал требований к видеопамяти, так что заранее понять, запустится ли модель на вашей карте, нельзя — придётся пробовать.
Смотреть сравнение →Две открытые модели под одной и той же лицензией Apache 2.0, вышедшие с разницей в девять дней — и показывающие, что «открытые веса» ничего не говорят о замысле. Hy3 сделана, чтобы ей пользовались как есть: 21 млрд активных параметров, встроенное ускорение генерации, рабочий результат на задачах с кодом. Inkling сделана, чтобы её дообучали: компания Миры Мурати прямо говорит, что это не самая сильная модель на рынке, а заготовка, которую бизнес доводит под себя — и зарабатывать они собираются на платформе кастомизации, а не на модели. Отсюда практический выбор: нужен работающий движок сегодня — Hy3, он и дешевле в инференсе за счёт вчетверо меньшей активной части. Нужна основа под собственную специализированную модель и есть команда, которая умеет дообучать, — Inkling, у него вчетверо больший контекст и нативная мультимодальность. Обе требуют серьёзного железа: 295B и 975B под подушкой не поднять.
Смотреть сравнение →Обе модели делают одно и то же — превращают текст в векторы для поиска по смыслу, — но подходят к задаче с разных сторон. Nemotron 3 Embed берёт качеством: первое место на RTEB с 78,5%, и это рабочий инструмент, который можно ставить в продукт. BitNet Embedding берёт экономией: однобитные веса позволяют крутить её на обычном процессоре вдвое быстрее, а вектор на выходе можно ужать вплоть до одного бита. Но выбирать между ними по цифрам не получится, потому что Microsoft прямо просит не использовать BitNet в реальных приложениях без дополнительной проверки — это исследовательская модель. Поэтому решение простое: делаете продукт — Nemotron. Изучаете, насколько далеко можно ужать эмбеддинги, или у вас нет ничего, кроме процессора, — BitNet, с ясным пониманием, что вы экспериментируете.
Смотреть сравнение →Редкий случай, когда сравнение поколений сводится не к «стала умнее», а к «стала экономнее». Gemini 3.6 Flash решает те же задачи, расходуя до 17% меньше токенов — а поскольку платят именно за токены, это прямое снижение цены без изменения прайс-листа. Улучшения в коде и рабочих задачах заявлены, но рекламируется именно экономия: Google прямо называет линейку Flash рабочей лошадкой, а не витриной. Практический вывод простой: если вы уже на 3.5 Flash — переход на 3.6 это бесплатная скидка, причин оставаться на старой версии нет. Если выбираете модель с нуля — сравнивать эти две между собой бессмысленно, берите новую. Единственное, чего от обновления ждать не стоит, — скачка качества: за ним Google отправляет к Pro, которая, впрочем, не обновлялась с февраля.
Смотреть сравнение →Два генератора картинок из больших экосистем, и различает их не качество — оба в верхушке рейтингов, оба рисуют читаемый текст, — а модель доступа. Nano Banana Pro это профессиональный инструмент: платный API, до 14 референсов, разрешение до 4K, интеграция куда угодно. Muse Image это функция экосистемы: бесплатно, но только внутри приложений Meta, без отдельного API, и с персонализацией, которая означает доступ модели к вашим данным — споры об использовании пользовательских фото начались в день запуска. Практический выбор: строите продукт или нужен контроль над разрешением и референсами — Nano Banana Pro. Генерируете для себя и уже живёте в Instagram/WhatsApp — Muse Image бесплатна и со второй строчкой Arena в трёх категориях. Для пользователя из РФ выбор теоретический: официально недоступны обе.
Смотреть сравнение →Обе модели превращают речь в текст, обе открытые, обе понимают русский — но построены под противоположные сценарии. Whisper — это офлайн-эталон: записали интервью, скормили файл, получили расшифровку; модель видит запись целиком и за счёт этого хорошо держит шум и акценты. Nemotron 3.5 ASR — это стриминг: транскрипция появляется по ходу речи с задержкой от 80 миллисекунд, пунктуация расставляется на лету, а 600 миллионов параметров позволяют крутить всё это на ноутбуке. Выбор по задаче: расшифровка готовых записей — Whisper, там его зрелая экосистема и годы обкатки. Живые субтитры, голосовой ассистент, звонки в реальном времени — Nemotron, потому что Whisper потоковый режим не родной и собирается из костылей. Если сомневаетесь, критерий один: существует ли аудиофайл до начала работы. Есть файл — Whisper. Файла ещё нет — Nemotron.
Смотреть сравнение →Сравнение поколений внутри одной компании — новое против того, чем большинство пользуется по привычке. Прежние модели ElevenLabs (линейка Flash/Multilingual) быстрые, дешёвые и отлично читают текст ровным естественным голосом — для озвучки статьи, простого ассистента или чернового варианта их хватает с запасом. Eleven v3 — это шаг от «прочитай» к «сыграй»: 70+ языков вместо ~32, управление интонацией через теги прямо в тексте ([шёпот], [смех], [пауза]) и диалоги на несколько голосов. Плата за выразительность — модель требует режиссуры: теги надо расставлять осознанно, иначе преимущество не раскроется. Практический выбор: нужна быстрая ровная озвучка большого объёма — берите прежние Flash-модели, они дешевле и проще. Нужна эмоция, акценты, персонажи, аудиокнига с диалогами — v3, но заложите время на расстановку тегов. Обе от одной компании, обе с русским, обе без официального доступа из РФ — так что выбор чисто по задаче.
Смотреть сравнение →Разные задачи под одной вывеской «генерация видео». Ray3 — для тех, кто отдаёт материал в постпродакшн: нативный 16-битный HDR и экспорт в EXR позволяют цветокорректировать ролик как обычный съёмочный кадр, и такого не даёт больше никто. Veo 3 — для тех, кому нужен готовый ролик сразу, со звуком и речью в одном проходе, без дальнейшей обработки. Если у вас есть колорист — Ray3. Если ролик уходит в соцсети как есть — Veo 3, и HDR вам просто не пригодится.
Смотреть сравнение →Две модели про роботов, но про разное. Robostral Navigate решает одну задачу — навигацию, зато делает это с одной дешёвой камеры и обходит даже системы с лидаром. GR00T N1.7 от NVIDIA — фундамент под универсальные действия гуманоида: манипуляции, взаимодействие с предметами, широкий репертуар движений. Если задача — довести робота из точки А в точку Б по сложной среде дёшево, это Robostral. Если нужен «мозг» под руки и разнообразные действия — GR00T. Они скорее дополняют друг друга, чем конкурируют: навигация плюс манипуляция — это два разных слоя одного робота.
Смотреть сравнение →Обе кодинг-модели Mistral, но под разные задачи. Codestral — про автодополнение и быстрые подсказки прямо в редакторе: печатаешь, она подсказывает продолжение. Devstral Small 2 — про агентную работу: дать ей задачу «поправь баг в этих файлах» и получить готовые изменения по нескольким файлам сразу. Если нужна быстрая подсказка по ходу набора — Codestral. Если нужен агент, который выполняет многошаговую задачу целиком, — Devstral. По железу Devstral требовательнее (24 млрд против более лёгкой Codestral), зато решает задачи, которые автодополнялке не под силу.
Смотреть сравнение →Редкий случай, когда более новая и более дешёвая модель почти догнала флагман классом выше. Opus 5 стоит вдвое дешевле Fable 5 по входному токену и обходит её на 7 из 12 общих бенчмарков — включая разрыв почти в 10 пунктов на агентном кодинге. Fable 5 удерживает первенство лишь на SWE-bench Pro, и то на 0,8 пункта. Практический вывод простой: для подавляющего большинства задач берите Opus 5 — то же качество за половину цены. Fable 5 оправдана только там, где нужен абсолютный потолок и та самая доля процента на самых тяжёлых задачах, а цена не важна.
Смотреть сравнение →