Как выбрать видеокарту для запуска нейросетей локально
Запустить нейросеть на своём компьютере реально, но упирается всё в одну деталь — видеокарту. Точнее, в объём её памяти. Разберём по шагам, как выбрать GPU под локальные модели и на чём не переплатить.
Главное — объём видеопамяти (VRAM)
Модель при запуске целиком грузится в память видеокарты. Если она не помещается — либо не запустится, либо часть уйдёт в обычную оперативную память, и скорость упадёт в разы. Поэтому объём VRAM важнее всего остального.
Грубый ориентир, сколько памяти нужно под модель в популярной 4-битной квантизации:
- 7–8 млрд параметров — примерно 5–6 ГБ VRAM. Влезет даже на бюджетную карту.
- 13–14 млрд — около 9–11 ГБ. Нужна карта на 12 ГБ.
- 30–34 млрд — примерно 20–24 ГБ. Уже уровень топовой десктопной карты.
- 70 млрд — около 40+ ГБ. В одну потребительскую карту не помещается.
Точную цифру под конкретную модель удобно прикинуть в калькуляторе VRAM.
Почему квантизация меняет всё
Квантизация — это сжатие весов модели: вместо 16 бит на число берут 8, 4 или даже меньше. Модель в 4-битной версии занимает примерно вчетверо меньше памяти, чем в исходной, почти без потери качества на большинстве задач. Именно поэтому дома почти всегда запускают квантованные версии — они позволяют уместить крупную модель в скромную карту. Подробнее — в разборе про квантизацию моделей.
На что смотреть, кроме гигабайтов
Объём — король, но не единственный параметр:
- Пропускная способность памяти — на скорость генерации токенов влияет даже сильнее, чем число ядер. Чем быстрее память, тем шустрее выдаётся текст.
- Поколение карты — новые архитектуры лучше работают с нужными типами вычислений.
- Экосистема — у карт NVIDIA поддержка в инструментах для ИИ пока самая широкая и беспроблемная; на альтернативах бывает больше возни с настройкой.
Частые ошибки
- Гнаться за игровыми показателями. Карта, топовая в играх, но с малым объёмом памяти, окажется хуже для нейросетей, чем более скромная, но с большим VRAM.
- Забывать про остальную систему. Оперативной памяти стоит иметь хотя бы столько же, сколько VRAM, а лучше вдвое больше.
- Брать «с запасом на будущее» самую дорогую карту. Модели дешевеют и оптимизируются: то, что вчера требовало 24 ГБ, завтра поедет на 12.
Что запомнить
- Для локальной нейросети главное — объём видеопамяти, а не игровая мощь.
- Ориентир под 4-битную модель: 7B — 6 ГБ, 14B — 12 ГБ, 34B — 24 ГБ.
- Квантизация позволяет уместить крупную модель в скромную карту.
- Кроме объёма важны скорость памяти и поддержка в инструментах.
- Точную потребность в памяти прикидывайте в калькуляторе VRAM.
Если под вашу карту крупная модель не влезает — не беда: можно взять модель поменьше. Как подобрать размер под своё железо, разбираем в отдельном гайде. А с чего вообще начать локальный запуск — в материале про запуск ИИ через Ollama.