ИИ ИИшка Про
Гайды

Как выбрать размер открытой модели под своё железо

AI-редакция

Вы скачали открытую модель, запустили — и всё зависло или выдало ошибку нехватки памяти. Знакомо. Проблема почти всегда в несоответствии размера модели вашему железу. Разберём по шагам, как выбрать версию, которая реально пойдёт.

Шаг 1. Что значат числа в названии

В названиях моделей стоят числа вроде 7B, 32B, 70B — это количество параметров в миллиардах (B — billion). Грубо: чем больше параметров, тем «умнее» модель, но тем больше памяти и мощности ей нужно.

  • 1–3B — крохотные, работают почти на всём, включая ноутбуки, но заметно слабее.
  • 7–9B — рабочий минимум для осмысленных задач, запускаются на видеокарте среднего уровня.
  • 14–32B — сильные модели, нужна хорошая видеокарта или две.
  • 70B и выше — уровень топовых, требуют серьёзного железа или нескольких видеокарт.

Размер — не единственное, что важно (новая 7B часто обходит старую 13B), но это первый ориентир для железа.

Шаг 2. Главное ограничение — видеопамять (VRAM)

Ключевой ресурс — не мощность, а объём видеопамяти (VRAM). Модель должна целиком поместиться в память видеокарты, иначе она либо не запустится, либо будет работать мучительно медленно, подгружая данные из обычной оперативки.

Очень грубая прикидка для стандартной точности: модели нужно примерно 2 гигабайта VRAM на каждый миллиард параметров. То есть 7B попросит около 14 ГБ, а 70B — уже за 140 ГБ, что выходит за пределы одной видеокарты. Точный расчёт под конкретную модель и точность удобно сделать в калькуляторе VRAM.

Шаг 3. Как кванты уменьшают аппетит

Вот тут вступает квантизация — сжатие модели за счёт снижения точности чисел. Она резко уменьшает требования к памяти почти без потери качества.

  • Полная точность — самая тяжёлая, редко нужна для запуска.
  • Q8 — половина от полного размера, качество практически не страдает.
  • Q4 — около четверти размера, небольшая потеря качества, самый популярный выбор.

С квантом Q4 та же 70B-модель, которой нужно было 140 ГБ, ужимается примерно до 40 ГБ — уже реально для мощной видеокарты или пары обычных. Подробно про уровни квантов — в отдельном материале что такое квантизация.

Шаг 4. Подбор под конкретное железо

Сориентируйтесь по своей видеокарте (очень приблизительно, с квантом Q4):

ВидеопамятьЧто реально запустить
8 ГБ7–8B комфортно
12 ГБдо 14B
16 ГБдо 22–32B впритык
24 ГБ32B комфортно, 70B впритык
48 ГБ+70B и крупнее

Это ориентир, а не закон: конкретные числа зависят от модели, кванта и длины контекста. Длинный контекст тоже ест память, и её надо закладывать сверху.

Шаг 5. Чем запускать

Определившись с размером, выбирайте инструмент. Для новичков проще всего Ollama или LM Studio — они сами качают нужный квант и запускают модель парой кликов. Опытным подойдут решения посложнее с тонкой настройкой. Начинать стоит с малого: возьмите модель на размер меньше, чем «влезает», убедитесь, что всё работает быстро, и только потом поднимайтесь.

Частая ошибка

Скачать самую большую версию «чтобы поумнее» и упереться в нехватку памяти. Лучше уверенно работающая 8B, чем 70B, которая еле ползёт, подгружая данные с диска. Комфортная скорость важнее лишних параметров, которые ваше железо не тянет.

Что запомнить

  • Число в названии (7B, 70B) — это параметры в миллиардах, первый ориентир по железу.
  • Главный ресурс — видеопамять: модель должна поместиться в неё целиком.
  • Кванты (Q4, Q8) резко снижают требования почти без потери качества.
  • Ориентируйтесь на свою VRAM и закладывайте память на длину контекста.
  • Лучше меньшая, но быстрая модель, чем большая, которая еле шевелится.

Точный расчёт памяти под модель — в калькуляторе VRAM. Что такое кванты и чем Q4 отличается от Q8 — в гайде про квантизацию.