ИИ ИИшка Про
← Все инструменты

Калькулятор VRAM

Скачали модель с Hugging Face и не уверены, что она запустится? Укажите размер, квантизацию и свою видеокарту — посчитаем, влезет ли.

0
веса, ГБ
0
контекст, ГБ
0
итого нужно, ГБ

Выберите параметры выше.

Как это считается

Вес модели ≈ число параметров × байт на параметр (у Q4_K_M это примерно 0,61 байта). Плюс память под контекст (KV-кэш) — она растёт линейно с окном и размером модели. Плюс ~10% запаса на служебные буферы. Оценка приблизительная: реальный расход зависит от движка (llama.cpp, vLLM, ExLlama), архитектуры модели и флагов вроде flash attention. Для MoE-моделей (Qwen3-235B-A22B и подобных) считайте по полному размеру — в память грузятся все эксперты, даже если работают не все.

Что означают Q4_K_M и другие обозначения — в гайде про квантизацию. Где брать сами модели — гайд по Hugging Face.