Как выбрать размер открытой модели под своё железо
Вы скачали открытую модель, запустили — и всё зависло или выдало ошибку нехватки памяти. Знакомо. Проблема почти всегда в несоответствии размера модели вашему железу. Разберём по шагам, как выбрать версию, которая реально пойдёт.
Шаг 1. Что значат числа в названии
В названиях моделей стоят числа вроде 7B, 32B, 70B — это количество параметров в миллиардах (B — billion). Грубо: чем больше параметров, тем «умнее» модель, но тем больше памяти и мощности ей нужно.
- 1–3B — крохотные, работают почти на всём, включая ноутбуки, но заметно слабее.
- 7–9B — рабочий минимум для осмысленных задач, запускаются на видеокарте среднего уровня.
- 14–32B — сильные модели, нужна хорошая видеокарта или две.
- 70B и выше — уровень топовых, требуют серьёзного железа или нескольких видеокарт.
Размер — не единственное, что важно (новая 7B часто обходит старую 13B), но это первый ориентир для железа.
Шаг 2. Главное ограничение — видеопамять (VRAM)
Ключевой ресурс — не мощность, а объём видеопамяти (VRAM). Модель должна целиком поместиться в память видеокарты, иначе она либо не запустится, либо будет работать мучительно медленно, подгружая данные из обычной оперативки.
Очень грубая прикидка для стандартной точности: модели нужно примерно 2 гигабайта VRAM на каждый миллиард параметров. То есть 7B попросит около 14 ГБ, а 70B — уже за 140 ГБ, что выходит за пределы одной видеокарты. Точный расчёт под конкретную модель и точность удобно сделать в калькуляторе VRAM.
Шаг 3. Как кванты уменьшают аппетит
Вот тут вступает квантизация — сжатие модели за счёт снижения точности чисел. Она резко уменьшает требования к памяти почти без потери качества.
- Полная точность — самая тяжёлая, редко нужна для запуска.
- Q8 — половина от полного размера, качество практически не страдает.
- Q4 — около четверти размера, небольшая потеря качества, самый популярный выбор.
С квантом Q4 та же 70B-модель, которой нужно было 140 ГБ, ужимается примерно до 40 ГБ — уже реально для мощной видеокарты или пары обычных. Подробно про уровни квантов — в отдельном материале что такое квантизация.
Шаг 4. Подбор под конкретное железо
Сориентируйтесь по своей видеокарте (очень приблизительно, с квантом Q4):
| Видеопамять | Что реально запустить |
|---|---|
| 8 ГБ | 7–8B комфортно |
| 12 ГБ | до 14B |
| 16 ГБ | до 22–32B впритык |
| 24 ГБ | 32B комфортно, 70B впритык |
| 48 ГБ+ | 70B и крупнее |
Это ориентир, а не закон: конкретные числа зависят от модели, кванта и длины контекста. Длинный контекст тоже ест память, и её надо закладывать сверху.
Шаг 5. Чем запускать
Определившись с размером, выбирайте инструмент. Для новичков проще всего Ollama или LM Studio — они сами качают нужный квант и запускают модель парой кликов. Опытным подойдут решения посложнее с тонкой настройкой. Начинать стоит с малого: возьмите модель на размер меньше, чем «влезает», убедитесь, что всё работает быстро, и только потом поднимайтесь.
Частая ошибка
Скачать самую большую версию «чтобы поумнее» и упереться в нехватку памяти. Лучше уверенно работающая 8B, чем 70B, которая еле ползёт, подгружая данные с диска. Комфортная скорость важнее лишних параметров, которые ваше железо не тянет.
Что запомнить
- Число в названии (7B, 70B) — это параметры в миллиардах, первый ориентир по железу.
- Главный ресурс — видеопамять: модель должна поместиться в неё целиком.
- Кванты (Q4, Q8) резко снижают требования почти без потери качества.
- Ориентируйтесь на свою VRAM и закладывайте память на длину контекста.
- Лучше меньшая, но быстрая модель, чем большая, которая еле шевелится.
Точный расчёт памяти под модель — в калькуляторе VRAM. Что такое кванты и чем Q4 отличается от Q8 — в гайде про квантизацию.