Калькулятор VRAM
Оцените требования к видеопамяти GPU для инференса LLM, полного дообучения, обучения LoRA и квантизации GGUF. Рассчитайте веса модели, KV-кэш, состояния оптимизатора и накладные расходы фреймворка из первых принципов, а затем проверьте, какие GPU подходят для вашей нагрузки. Бесплатно, мгновенно и абсолютно приватно.
Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.
32 layers · 8 KV heads · head dim 128
Model Architecture
Workload Mode
Weights + KV cache + minimal activations. Smallest footprint.
Weight Precision
Context & Batch
Total VRAM Required
for inference
8.03B params · FP16 · seq 4,096 · batch 1
Model Weights
14.96 GB
KV Cache
512 MB
Activations
31 MB
Overhead
1.08 GB
NVIDIA RTX 4090 (24 GB) (24 GB)
✅ Fits on a single GPU (69.0% VRAM used)
On-prem dev/inference, small models
VRAM Breakdown
Precision Comparison (Same Config)
| Precision | Weights | Total VRAM | Fits 24 GB? |
|---|---|---|---|
| FP32 | 29.91 GB | 33.14 GB | ✗ No |
| FP16 Selected | 14.96 GB | 16.57 GB | ✓ Yes |
| BF16 | 14.96 GB | 16.57 GB | ✓ Yes |
| FP8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT4 | 3.74 GB | 4.54 GB | ✓ Yes |
GPU Compatibility
| GPU | VRAM | GPUs Needed | Status |
|---|---|---|---|
NVIDIA RTX 4090 (24 GB)Selected On-prem dev/inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A10G (24 GB) Inference & ML serving | 24 GB | 1× | Single GPU |
NVIDIA L4 (24 GB) Cost-efficient inference | 24 GB | 1× | Single GPU |
NVIDIA RTX 3090 (24 GB) Budget on-prem inference | 24 GB | 1× | Single GPU |
Apple M4 Pro (24 GB unified) Mac inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A100 40 GB Training medium models, inference | 40 GB | 1× | Single GPU |
NVIDIA L40S (48 GB) Inference, multi-modal workloads | 48 GB | 1× | Single GPU |
NVIDIA A40 (48 GB) Inference & fine-tuning | 48 GB | 1× | Single GPU |
Apple M4 Max (48 GB unified) Mac inference, light fine-tuning | 48 GB | 1× | Single GPU |
NVIDIA H100 / H100 PCIe (80 GB) LLM training & production inference | 80 GB | 1× | Single GPU |
NVIDIA A100 80 GB LLM fine-tuning & inference | 80 GB | 1× | Single GPU |
AMD MI250X (128 GB) Large-scale HPC & LLM training | 128 GB | 1× | Single GPU |
Apple M4 Ultra (128 GB unified) On-device Mac inference | 128 GB | 1× | Single GPU |
NVIDIA H200 SXM (141 GB) Largest LLM inference & training | 141 GB | 1× | Single GPU |
AMD MI300X (192 GB) Very large model inference & training | 192 GB | 1× | Single GPU |
NVIDIA RTX 3080 (10 GB) Small model inference only | 10 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4070 (12 GB) Light inference, LoRA tuning | 12 GB | 2× | 2× Multi-GPU |
NVIDIA V100 (16 GB) Legacy workloads | 16 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4080 (16 GB) Consumer dev, small inference | 16 GB | 2× | 2× Multi-GPU |
Зачем использовать наш калькулятор VRAM
Планирование железа для LLM без измерения памяти GPU часто приводит к переплате за лишние карты или к ошибкам нехватки памяти (OOM) во время работы. Этот калькулятор использует настоящую формулу VRAM вместо приблизительных правил, чтобы вы уверенно подбирали GPU до аренды или покупки.
Выбирайте режимы инференса, полного дообучения, обучения LoRA и квантизации GGUF: каждый применяет правильную формулу для своей нагрузки и мгновенно обновляет веса, KV-кэш, состояния оптимизатора и накладные расходы фреймворка.
- Расчёты из первых принципов: веса, KV-кэш, активации, состояния оптимизатора, градиенты и накладные расходы фреймворка, а не догадки.
- Полная приватность: конфигурации считаются в браузере и никогда не отправляются на сервер.
- Режимы инференса, дообучения, LoRA и GGUF, каждый со своей формулой VRAM.
- Таблица совместимости из 19 GPU, включая H100, A100, RTX 4090, AMD MI300X и Apple Silicon.
Типичные сценарии использования
От выбора железа до планирования обучения: вот сценарии, в которых надёжная оценка VRAM экономит время и деньги.
- Выбор GPU для инференса LLM: проверить, помещается ли модель 70B на одну A100 80 ГБ или нужны две карты.
- Планирование дообучения: полное дообучение с Adam часто требует в 3-6 раз больше памяти, чем инференс.
- Оптимизация KV-кэша для длинных контекстов: увидеть, сколько VRAM добавляет рост с 4K до 32K или 128K токенов.
- Выбор подходящей квантизации GGUF: сравнить Q4, Q5 и Q8 и их баланс качества и памяти.
- Запуск моделей на потребительском железе: узнать, какие квантованные модели помещаются в 12, 16 или 24 ГБ VRAM.
- Планирование бюджета обучения LoRA: оценить, как выбранный ранг влияет на требуемую память.
Как рассчитывается VRAM и какие у расчёта границы
VRAM - это память видеокарты, а не системная RAM: веса, KV-кэш, активации и буферы фреймворка должны одновременно помещаться в этот фиксированный бюджет. Объём зависит от числа параметров, числовой точности, длины последовательности и размера батча, а также от типа нагрузки (инференс, обучение или LoRA). Мы используем те же формулы, что и vLLM, Transformers и llama.cpp внутри себя.
Калькулятор даёт инженерные оценки, а не точные измерения: реальный расход может отличаться на ±10-20 % в зависимости от рантайма, реализации модели, захвата CUDA-графов и фрагментации памяти. Все вычисления выполняются локально в браузере.
- Укажите число параметров и точность: модель 7B в FP16 занимает около 14 ГБ, в INT4 - около 3,5 ГБ.
- Добавьте KV-кэш по слоям, KV-головам, размерности головы, длине последовательности и батчу; GQA сильно его сокращает.
- Для обучения добавьте градиенты и состояния оптимизатора Adam: около 12 дополнительных байт на параметр при полном дообучении.
- Добавьте накладные расходы фреймворка: мы резервируем 7 % на PyTorch, CUDA и фрагментацию памяти.
Часто задаваемые вопросы
Калькулятор VRAM оценивает объём памяти GPU, необходимый для загрузки и работы большой языковой модели. Он вычисляет память под веса модели (параметры × байты на точность), KV-кэш (по длине последовательности, размеру батча и архитектуре внимания), активации, а для обучения - состояния оптимизатора и градиенты. Всё работает в браузере без загрузки данных на сервер.
Число параметров обычно указано в названии модели (7B, 70B, 405B). Точные значения есть в файле config.json модели на Hugging Face в поле "num_parameters". В наших пресетах указаны точные значения параметров для популярных моделей: Llama 3.1, Qwen2.5, Mistral и Gemma 2.
При полном дообучении GPU должна хранить веса модели, тензоры градиентов того же размера и состояние оптимизатора Adam (первый момент, второй момент и мастер-веса FP32) - это примерно 12 дополнительных байт на параметр. Для модели 7B в BF16 инференс требует ~14 ГБ, а полное обучение - ~60-80 ГБ.
KV-кэш хранит ключи и значения внимания для всех предыдущих токенов. Его размер = 2 × слои × KV-головы × размерность головы × длина последовательности × размер батча × байты. Он линейно растёт с контекстом: переход с 4K на 128K токенов увеличивает его в 32 раза. GQA уменьшает число KV-голов и заметно сокращает кэш.
Режим GGUF считает память весов как параметры × (биты квантизации / 8) байт. KV-кэш всегда хранится в FP16 независимо от квантизации весов. Q4_K_M (≈4 бита) - самый популярный баланс качества и экономии памяти для пользователей llama.cpp и Ollama.
GQA сокращает число голов ключей и значений до части голов запросов. Поскольку KV-кэш масштабируется с KV-головами, GQA может уменьшить его в 4 раза и более. Llama 3.1 использует 8 KV-голов против 32 голов запросов. Введите num_key_value_heads из config.json для точной оценки.
В FP16 модель 70B требует около 140 ГБ только под веса и помещается на двух картах H100 по 80 ГБ. В INT4 веса падают до ~35 ГБ и помещаются на одной H100. Таблица совместимости GPU показывает минимальное число карт для каждой модели из вашей конфигурации.
Калькулятор использует стандартную теоретическую формулу, на которой основаны все рантаймы. Paged attention в vLLM может добавить 5-15 % накладных расходов. llama.cpp отображает веса в память и может запускать более крупные модели. Буфер в 7 % покрывает большинство различий между рантаймами. Всегда проверяйте небольшим тестовым запуском перед продакшеном.
Да. Калькулятор VRAM полностью работает в вашем браузере. Параметры архитектуры, точности и настройки контекста обрабатываются локально на вашем устройстве и никогда не отправляются на сервер. Аккаунт и регистрация не нужны.