ИИ ИИшка Про
Гайды

Как выбрать видеокарту для запуска нейросетей локально

AI-редакция

Запустить нейросеть на своём компьютере реально, но упирается всё в одну деталь — видеокарту. Точнее, в объём её памяти. Разберём по шагам, как выбрать GPU под локальные модели и на чём не переплатить.

Главное — объём видеопамяти (VRAM)

Модель при запуске целиком грузится в память видеокарты. Если она не помещается — либо не запустится, либо часть уйдёт в обычную оперативную память, и скорость упадёт в разы. Поэтому объём VRAM важнее всего остального.

Грубый ориентир, сколько памяти нужно под модель в популярной 4-битной квантизации:

  • 7–8 млрд параметров — примерно 5–6 ГБ VRAM. Влезет даже на бюджетную карту.
  • 13–14 млрд — около 9–11 ГБ. Нужна карта на 12 ГБ.
  • 30–34 млрд — примерно 20–24 ГБ. Уже уровень топовой десктопной карты.
  • 70 млрд — около 40+ ГБ. В одну потребительскую карту не помещается.

Точную цифру под конкретную модель удобно прикинуть в калькуляторе VRAM.

Почему квантизация меняет всё

Квантизация — это сжатие весов модели: вместо 16 бит на число берут 8, 4 или даже меньше. Модель в 4-битной версии занимает примерно вчетверо меньше памяти, чем в исходной, почти без потери качества на большинстве задач. Именно поэтому дома почти всегда запускают квантованные версии — они позволяют уместить крупную модель в скромную карту. Подробнее — в разборе про квантизацию моделей.

На что смотреть, кроме гигабайтов

Объём — король, но не единственный параметр:

  • Пропускная способность памяти — на скорость генерации токенов влияет даже сильнее, чем число ядер. Чем быстрее память, тем шустрее выдаётся текст.
  • Поколение карты — новые архитектуры лучше работают с нужными типами вычислений.
  • Экосистема — у карт NVIDIA поддержка в инструментах для ИИ пока самая широкая и беспроблемная; на альтернативах бывает больше возни с настройкой.

Частые ошибки

  • Гнаться за игровыми показателями. Карта, топовая в играх, но с малым объёмом памяти, окажется хуже для нейросетей, чем более скромная, но с большим VRAM.
  • Забывать про остальную систему. Оперативной памяти стоит иметь хотя бы столько же, сколько VRAM, а лучше вдвое больше.
  • Брать «с запасом на будущее» самую дорогую карту. Модели дешевеют и оптимизируются: то, что вчера требовало 24 ГБ, завтра поедет на 12.

Что запомнить

  • Для локальной нейросети главное — объём видеопамяти, а не игровая мощь.
  • Ориентир под 4-битную модель: 7B — 6 ГБ, 14B — 12 ГБ, 34B — 24 ГБ.
  • Квантизация позволяет уместить крупную модель в скромную карту.
  • Кроме объёма важны скорость памяти и поддержка в инструментах.
  • Точную потребность в памяти прикидывайте в калькуляторе VRAM.

Если под вашу карту крупная модель не влезает — не беда: можно взять модель поменьше. Как подобрать размер под своё железо, разбираем в отдельном гайде. А с чего вообще начать локальный запуск — в материале про запуск ИИ через Ollama.