Saltar al contenido
Aback Tools Logo

Calculadora de VRAM

Estima los requisitos de VRAM de la GPU para inferencia de LLM, ajuste fino completo, entrenamiento LoRA y cuantización GGUF. Calcula los pesos del modelo, la caché KV, los estados del optimizador y la sobrecarga del framework desde primeros principios y comprueba qué GPU se ajustan a tu carga de trabajo. Gratis, instantáneo y totalmente privado.

VRAM Calculator

Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.

32 layers · 8 KV heads · head dim 128

Model Architecture

B

Workload Mode

Weights + KV cache + minimal activations. Smallest footprint.

Weight Precision

Context & Batch

tokens
51264K128K
reqs
13264

Total VRAM Required

16.57 GB

for inference

8.03B params · FP16 · seq 4,096 · batch 1

Model Weights

14.96 GB

KV Cache

512 MB

Activations

31 MB

Overhead

1.08 GB

NVIDIA RTX 4090 (24 GB) (24 GB)

✅ Fits on a single GPU (69.0% VRAM used)

Single GPU ✓
VRAM Usage16.57 GB / 24 GB (69.0%)

On-prem dev/inference, small models

VRAM Breakdown

Model Weights14.96 GB (90.3%)
KV Cache512 MB (3.0%)
Activations31 MB (0.2%)
Framework Overhead1.08 GB (6.5%)

Precision Comparison (Same Config)

PrecisionWeightsTotal VRAMFits 24 GB?
FP3229.91 GB33.14 GB✗ No
FP16 Selected14.96 GB16.57 GB✓ Yes
BF1614.96 GB16.57 GB✓ Yes
FP87.48 GB8.55 GB✓ Yes
INT87.48 GB8.55 GB✓ Yes
INT43.74 GB4.54 GB✓ Yes

GPU Compatibility

GPUVRAMGPUs NeededStatus
NVIDIA RTX 4090 (24 GB)Selected
On-prem dev/inference, small models
24 GB1×Single GPU
NVIDIA A10G (24 GB)
Inference & ML serving
24 GB1×Single GPU
NVIDIA L4 (24 GB)
Cost-efficient inference
24 GB1×Single GPU
NVIDIA RTX 3090 (24 GB)
Budget on-prem inference
24 GB1×Single GPU
Apple M4 Pro (24 GB unified)
Mac inference, small models
24 GB1×Single GPU
NVIDIA A100 40 GB
Training medium models, inference
40 GB1×Single GPU
NVIDIA L40S (48 GB)
Inference, multi-modal workloads
48 GB1×Single GPU
NVIDIA A40 (48 GB)
Inference & fine-tuning
48 GB1×Single GPU
Apple M4 Max (48 GB unified)
Mac inference, light fine-tuning
48 GB1×Single GPU
NVIDIA H100 / H100 PCIe (80 GB)
LLM training & production inference
80 GB1×Single GPU
NVIDIA A100 80 GB
LLM fine-tuning & inference
80 GB1×Single GPU
AMD MI250X (128 GB)
Large-scale HPC & LLM training
128 GB1×Single GPU
Apple M4 Ultra (128 GB unified)
On-device Mac inference
128 GB1×Single GPU
NVIDIA H200 SXM (141 GB)
Largest LLM inference & training
141 GB1×Single GPU
AMD MI300X (192 GB)
Very large model inference & training
192 GB1×Single GPU
NVIDIA RTX 3080 (10 GB)
Small model inference only
10 GB2×2× Multi-GPU
NVIDIA RTX 4070 (12 GB)
Light inference, LoRA tuning
12 GB2×2× Multi-GPU
NVIDIA V100 (16 GB)
Legacy workloads
16 GB2×2× Multi-GPU
NVIDIA RTX 4080 (16 GB)
Consumer dev, small inference
16 GB2×2× Multi-GPU
Estimation Notes: VRAM estimates use the standard formula: weights × bytes/param + KV cache (2 × layers × KV-heads × head-dim × seq-len × batch × FP16 bytes) + framework overhead (7%). Training estimates include Adam optimizer states and gradients. Actual usage varies by runtime (vLLM, llama.cpp, Transformers), quantisation method, and model architecture specifics. Always leave 10-15% VRAM headroom. All calculations run locally in your browser.

Por qué usar nuestra calculadora de VRAM

Planificar el hardware para LLM sin medir la memoria de GPU suele acabar en tarjetas sobredimensionadas o en errores de memoria insuficiente (OOM) en plena ejecución. Esta calculadora aplica la fórmula real de la VRAM en lugar de reglas aproximadas, de modo que puedes dimensionar GPUs con confianza antes de alquilar o comprar.

Elige entre los modos de inferencia, ajuste fino completo, entrenamiento LoRA y cuantización GGUF: cada modo aplica la fórmula correcta para esa carga de trabajo y actualiza al instante los pesos, la caché KV, los estados del optimizador y la sobrecarga del framework.

  • Cálculos desde primeros principios: pesos, caché KV, activaciones, estados del optimizador, gradientes y sobrecarga del framework, no estimaciones a ojo.
  • Totalmente privada: tus configuraciones se calculan en tu navegador y nunca se envían a ningún servidor.
  • Modos de inferencia, ajuste fino, LoRA y GGUF, cada uno con su fórmula de VRAM específica.
  • Tabla de compatibilidad con 19 GPU, incluidas H100, A100, RTX 4090, AMD MI300X y Apple Silicon.

Casos de uso habituales

Desde la selección de hardware hasta la planificación de entrenamientos, estos son los escenarios en los que una estimación fiable de VRAM ahorra tiempo y dinero.

  • Elegir una GPU para inferencia de LLM: comprobar si un modelo de 70B cabe en una sola A100 de 80 GB o necesita dos GPU.
  • Planificar ejecuciones de ajuste fino: el ajuste completo con Adam suele requerir de 3 a 6 veces la memoria de la inferencia.
  • Optimizar la caché KV para contextos largos: ver cuánta VRAM adicional consume pasar de 4K a 32K o 128K tokens.
  • Elegir la cuantización GGUF adecuada: comparar Q4, Q5 y Q8 y su equilibrio entre calidad y memoria.
  • Ejecutar modelos en hardware de consumo: saber qué modelos cuantizados caben en 12, 16 o 24 GB de VRAM.
  • Planificar el presupuesto de entrenamiento LoRA: ver cómo el rango elegido afecta a la memoria necesaria.

Cómo se calcula la VRAM y qué límites tiene

La VRAM es la memoria de la GPU, no la RAM del sistema: los pesos, la caché KV, las activaciones y los búferes del framework deben caber a la vez en ese presupuesto fijo. La cantidad necesaria depende del número de parámetros, la precisión numérica, la longitud de secuencia y el tamaño de lote, y del tipo de carga de trabajo (inferencia, entrenamiento o LoRA). Usamos las mismas fórmulas que aplican internamente vLLM, Transformers y llama.cpp.

La calculadora ofrece estimaciones de nivel de ingeniería, no medidas exactas: el uso real puede variar un ±10-20 % según el runtime, la implementación del modelo, la captura de grafos CUDA y la fragmentación de memoria. Todas las operaciones se ejecutan localmente en tu navegador.

  1. Indica los parámetros del modelo y la precisión: un modelo de 7B en FP16 ocupa unos 14 GB y en INT4 unos 3,5 GB.
  2. Añade la caché KV a partir de capas, cabezas KV, dimensión de cabeza, longitud de secuencia y lote; el GQA la reduce drásticamente.
  3. Para entrenamiento, suma gradientes y estados del optimizador Adam: unos 12 bytes extra por parámetro en el ajuste completo.
  4. Añade la sobrecarga del framework: reservamos un margen del 7 % para PyTorch, CUDA y la fragmentación de memoria.

Preguntas frecuentes

Una calculadora de VRAM estima la memoria de GPU necesaria para cargar y ejecutar un modelo de lenguaje grande. Calcula el almacenamiento de los pesos del modelo (parámetros × bytes por precisión), la caché KV (a partir de la longitud de secuencia, el tamaño de lote y la arquitectura de atención), las activaciones y, para el entrenamiento, los estados del optimizador y los gradientes. Funciona por completo en tu navegador y no sube ningún dato.

El número de parámetros suele aparecer en el nombre del modelo (7B, 70B, 405B). Para valores exactos, consulta el archivo config.json del modelo en Hugging Face y busca el campo "num_parameters". Nuestros presets incluyen recuentos precisos de parámetros para modelos populares como Llama 3.1, Qwen2.5, Mistral y Gemma 2.

Durante el ajuste fino completo, la GPU debe almacenar los pesos del modelo, tensores de gradiente del mismo tamaño y el estado del optimizador Adam (primer momento, segundo momento y pesos maestros en FP32), lo que añade unos 12 bytes extra por parámetro. Para un modelo de 7B en BF16, la inferencia necesita ~14 GB, pero el entrenamiento completo requiere ~60-80 GB.

La caché KV guarda las claves y valores de atención de todos los tokens anteriores. Su tamaño = 2 × capas × cabezas KV × dimensión de cabeza × longitud de secuencia × tamaño de lote × bytes. Crece de forma lineal con el contexto: pasar de 4K a 128K tokens la multiplica por 32. El GQA reduce las cabezas KV y recorta mucho su tamaño.

El modo GGUF calcula la memoria de los pesos como parámetros × (bits de cuantización / 8) bytes. La caché KV siempre se guarda en FP16, independientemente de la cuantización de los pesos. Q4_K_M (≈4 bits) es el equilibrio más popular entre calidad y eficiencia de memoria para usuarios de llama.cpp y Ollama.

El GQA reduce el número de cabezas de clave y valor a una fracción de las cabezas de consulta. Como la caché KV escala con las cabezas KV, el GQA puede reducirla 4 veces o más. Llama 3.1 usa 8 cabezas KV frente a 32 cabezas de consulta. Introduce num_key_value_heads desde config.json para obtener estimaciones precisas.

En FP16, un modelo de 70B requiere unos 140 GB solo para los pesos, y cabe en dos tarjetas H100 de 80 GB. En INT4 los pesos bajan a ~35 GB y caben en una sola H100. La tabla de compatibilidad de GPU muestra el número mínimo de GPU para cada tarjeta de tu configuración.

La calculadora usa la fórmula teórica estándar en la que se basan todos los runtimes. La atención paginada de vLLM puede añadir un 5-15 % de sobrecarga. llama.cpp mapea los pesos en memoria y puede ejecutar modelos mayores. El margen de sobrecarga del 7 % cubre la mayor parte de la variación entre runtimes. Valida siempre con una prueba pequeña antes de desplegar en producción.

Sí. La calculadora de VRAM se ejecuta por completo en tu navegador. Los parámetros de arquitectura, las precisiones y la configuración de contexto se procesan localmente en tu dispositivo y nunca se envían a ningún servidor. No hace falta cuenta ni registro.