Калькулятор VRAM
Скачали модель с Hugging Face и не уверены, что она запустится? Укажите размер, квантизацию и свою видеокарту — посчитаем, влезет ли.
Выберите параметры выше.
Как это считается
Вес модели ≈ число параметров × байт на параметр (у Q4_K_M это примерно 0,61 байта). Плюс память под контекст (KV-кэш) — она растёт линейно с окном и размером модели. Плюс ~10% запаса на служебные буферы. Оценка приблизительная: реальный расход зависит от движка (llama.cpp, vLLM, ExLlama), архитектуры модели и флагов вроде flash attention. Для MoE-моделей (Qwen3-235B-A22B и подобных) считайте по полному размеру — в память грузятся все эксперты, даже если работают не все.
Что означают Q4_K_M и другие обозначения — в гайде про квантизацию. Где брать сами модели — гайд по Hugging Face.