Перейти к содержимому
Aback Tools Logo

Калькулятор VRAM

Оцените требования к видеопамяти GPU для инференса LLM, полного дообучения, обучения LoRA и квантизации GGUF. Рассчитайте веса модели, KV-кэш, состояния оптимизатора и накладные расходы фреймворка из первых принципов, а затем проверьте, какие GPU подходят для вашей нагрузки. Бесплатно, мгновенно и абсолютно приватно.

VRAM Calculator

Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.

32 layers · 8 KV heads · head dim 128

Model Architecture

B

Workload Mode

Weights + KV cache + minimal activations. Smallest footprint.

Weight Precision

Context & Batch

tokens
51264K128K
reqs
13264

Total VRAM Required

16.57 GB

for inference

8.03B params · FP16 · seq 4,096 · batch 1

Model Weights

14.96 GB

KV Cache

512 MB

Activations

31 MB

Overhead

1.08 GB

NVIDIA RTX 4090 (24 GB) (24 GB)

✅ Fits on a single GPU (69.0% VRAM used)

Single GPU ✓
VRAM Usage16.57 GB / 24 GB (69.0%)

On-prem dev/inference, small models

VRAM Breakdown

Model Weights14.96 GB (90.3%)
KV Cache512 MB (3.0%)
Activations31 MB (0.2%)
Framework Overhead1.08 GB (6.5%)

Precision Comparison (Same Config)

PrecisionWeightsTotal VRAMFits 24 GB?
FP3229.91 GB33.14 GB✗ No
FP16 Selected14.96 GB16.57 GB✓ Yes
BF1614.96 GB16.57 GB✓ Yes
FP87.48 GB8.55 GB✓ Yes
INT87.48 GB8.55 GB✓ Yes
INT43.74 GB4.54 GB✓ Yes

GPU Compatibility

GPUVRAMGPUs NeededStatus
NVIDIA RTX 4090 (24 GB)Selected
On-prem dev/inference, small models
24 GB1×Single GPU
NVIDIA A10G (24 GB)
Inference & ML serving
24 GB1×Single GPU
NVIDIA L4 (24 GB)
Cost-efficient inference
24 GB1×Single GPU
NVIDIA RTX 3090 (24 GB)
Budget on-prem inference
24 GB1×Single GPU
Apple M4 Pro (24 GB unified)
Mac inference, small models
24 GB1×Single GPU
NVIDIA A100 40 GB
Training medium models, inference
40 GB1×Single GPU
NVIDIA L40S (48 GB)
Inference, multi-modal workloads
48 GB1×Single GPU
NVIDIA A40 (48 GB)
Inference & fine-tuning
48 GB1×Single GPU
Apple M4 Max (48 GB unified)
Mac inference, light fine-tuning
48 GB1×Single GPU
NVIDIA H100 / H100 PCIe (80 GB)
LLM training & production inference
80 GB1×Single GPU
NVIDIA A100 80 GB
LLM fine-tuning & inference
80 GB1×Single GPU
AMD MI250X (128 GB)
Large-scale HPC & LLM training
128 GB1×Single GPU
Apple M4 Ultra (128 GB unified)
On-device Mac inference
128 GB1×Single GPU
NVIDIA H200 SXM (141 GB)
Largest LLM inference & training
141 GB1×Single GPU
AMD MI300X (192 GB)
Very large model inference & training
192 GB1×Single GPU
NVIDIA RTX 3080 (10 GB)
Small model inference only
10 GB2×2× Multi-GPU
NVIDIA RTX 4070 (12 GB)
Light inference, LoRA tuning
12 GB2×2× Multi-GPU
NVIDIA V100 (16 GB)
Legacy workloads
16 GB2×2× Multi-GPU
NVIDIA RTX 4080 (16 GB)
Consumer dev, small inference
16 GB2×2× Multi-GPU
Estimation Notes: VRAM estimates use the standard formula: weights × bytes/param + KV cache (2 × layers × KV-heads × head-dim × seq-len × batch × FP16 bytes) + framework overhead (7%). Training estimates include Adam optimizer states and gradients. Actual usage varies by runtime (vLLM, llama.cpp, Transformers), quantisation method, and model architecture specifics. Always leave 10-15% VRAM headroom. All calculations run locally in your browser.

Зачем использовать наш калькулятор VRAM

Планирование железа для LLM без измерения памяти GPU часто приводит к переплате за лишние карты или к ошибкам нехватки памяти (OOM) во время работы. Этот калькулятор использует настоящую формулу VRAM вместо приблизительных правил, чтобы вы уверенно подбирали GPU до аренды или покупки.

Выбирайте режимы инференса, полного дообучения, обучения LoRA и квантизации GGUF: каждый применяет правильную формулу для своей нагрузки и мгновенно обновляет веса, KV-кэш, состояния оптимизатора и накладные расходы фреймворка.

  • Расчёты из первых принципов: веса, KV-кэш, активации, состояния оптимизатора, градиенты и накладные расходы фреймворка, а не догадки.
  • Полная приватность: конфигурации считаются в браузере и никогда не отправляются на сервер.
  • Режимы инференса, дообучения, LoRA и GGUF, каждый со своей формулой VRAM.
  • Таблица совместимости из 19 GPU, включая H100, A100, RTX 4090, AMD MI300X и Apple Silicon.

Типичные сценарии использования

От выбора железа до планирования обучения: вот сценарии, в которых надёжная оценка VRAM экономит время и деньги.

  • Выбор GPU для инференса LLM: проверить, помещается ли модель 70B на одну A100 80 ГБ или нужны две карты.
  • Планирование дообучения: полное дообучение с Adam часто требует в 3-6 раз больше памяти, чем инференс.
  • Оптимизация KV-кэша для длинных контекстов: увидеть, сколько VRAM добавляет рост с 4K до 32K или 128K токенов.
  • Выбор подходящей квантизации GGUF: сравнить Q4, Q5 и Q8 и их баланс качества и памяти.
  • Запуск моделей на потребительском железе: узнать, какие квантованные модели помещаются в 12, 16 или 24 ГБ VRAM.
  • Планирование бюджета обучения LoRA: оценить, как выбранный ранг влияет на требуемую память.

Как рассчитывается VRAM и какие у расчёта границы

VRAM - это память видеокарты, а не системная RAM: веса, KV-кэш, активации и буферы фреймворка должны одновременно помещаться в этот фиксированный бюджет. Объём зависит от числа параметров, числовой точности, длины последовательности и размера батча, а также от типа нагрузки (инференс, обучение или LoRA). Мы используем те же формулы, что и vLLM, Transformers и llama.cpp внутри себя.

Калькулятор даёт инженерные оценки, а не точные измерения: реальный расход может отличаться на ±10-20 % в зависимости от рантайма, реализации модели, захвата CUDA-графов и фрагментации памяти. Все вычисления выполняются локально в браузере.

  1. Укажите число параметров и точность: модель 7B в FP16 занимает около 14 ГБ, в INT4 - около 3,5 ГБ.
  2. Добавьте KV-кэш по слоям, KV-головам, размерности головы, длине последовательности и батчу; GQA сильно его сокращает.
  3. Для обучения добавьте градиенты и состояния оптимизатора Adam: около 12 дополнительных байт на параметр при полном дообучении.
  4. Добавьте накладные расходы фреймворка: мы резервируем 7 % на PyTorch, CUDA и фрагментацию памяти.

Часто задаваемые вопросы

Калькулятор VRAM оценивает объём памяти GPU, необходимый для загрузки и работы большой языковой модели. Он вычисляет память под веса модели (параметры × байты на точность), KV-кэш (по длине последовательности, размеру батча и архитектуре внимания), активации, а для обучения - состояния оптимизатора и градиенты. Всё работает в браузере без загрузки данных на сервер.

Число параметров обычно указано в названии модели (7B, 70B, 405B). Точные значения есть в файле config.json модели на Hugging Face в поле "num_parameters". В наших пресетах указаны точные значения параметров для популярных моделей: Llama 3.1, Qwen2.5, Mistral и Gemma 2.

При полном дообучении GPU должна хранить веса модели, тензоры градиентов того же размера и состояние оптимизатора Adam (первый момент, второй момент и мастер-веса FP32) - это примерно 12 дополнительных байт на параметр. Для модели 7B в BF16 инференс требует ~14 ГБ, а полное обучение - ~60-80 ГБ.

KV-кэш хранит ключи и значения внимания для всех предыдущих токенов. Его размер = 2 × слои × KV-головы × размерность головы × длина последовательности × размер батча × байты. Он линейно растёт с контекстом: переход с 4K на 128K токенов увеличивает его в 32 раза. GQA уменьшает число KV-голов и заметно сокращает кэш.

Режим GGUF считает память весов как параметры × (биты квантизации / 8) байт. KV-кэш всегда хранится в FP16 независимо от квантизации весов. Q4_K_M (≈4 бита) - самый популярный баланс качества и экономии памяти для пользователей llama.cpp и Ollama.

GQA сокращает число голов ключей и значений до части голов запросов. Поскольку KV-кэш масштабируется с KV-головами, GQA может уменьшить его в 4 раза и более. Llama 3.1 использует 8 KV-голов против 32 голов запросов. Введите num_key_value_heads из config.json для точной оценки.

В FP16 модель 70B требует около 140 ГБ только под веса и помещается на двух картах H100 по 80 ГБ. В INT4 веса падают до ~35 ГБ и помещаются на одной H100. Таблица совместимости GPU показывает минимальное число карт для каждой модели из вашей конфигурации.

Калькулятор использует стандартную теоретическую формулу, на которой основаны все рантаймы. Paged attention в vLLM может добавить 5-15 % накладных расходов. llama.cpp отображает веса в память и может запускать более крупные модели. Буфер в 7 % покрывает большинство различий между рантаймами. Всегда проверяйте небольшим тестовым запуском перед продакшеном.

Да. Калькулятор VRAM полностью работает в вашем браузере. Параметры архитектуры, точности и настройки контекста обрабатываются локально на вашем устройстве и никогда не отправляются на сервер. Аккаунт и регистрация не нужны.