Calculadora de VRAM
Estima los requisitos de VRAM de la GPU para inferencia de LLM, ajuste fino completo, entrenamiento LoRA y cuantización GGUF. Calcula los pesos del modelo, la caché KV, los estados del optimizador y la sobrecarga del framework desde primeros principios y comprueba qué GPU se ajustan a tu carga de trabajo. Gratis, instantáneo y totalmente privado.
Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.
32 layers · 8 KV heads · head dim 128
Model Architecture
Workload Mode
Weights + KV cache + minimal activations. Smallest footprint.
Weight Precision
Context & Batch
Total VRAM Required
for inference
8.03B params · FP16 · seq 4,096 · batch 1
Model Weights
14.96 GB
KV Cache
512 MB
Activations
31 MB
Overhead
1.08 GB
NVIDIA RTX 4090 (24 GB) (24 GB)
✅ Fits on a single GPU (69.0% VRAM used)
On-prem dev/inference, small models
VRAM Breakdown
Precision Comparison (Same Config)
| Precision | Weights | Total VRAM | Fits 24 GB? |
|---|---|---|---|
| FP32 | 29.91 GB | 33.14 GB | ✗ No |
| FP16 Selected | 14.96 GB | 16.57 GB | ✓ Yes |
| BF16 | 14.96 GB | 16.57 GB | ✓ Yes |
| FP8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT4 | 3.74 GB | 4.54 GB | ✓ Yes |
GPU Compatibility
| GPU | VRAM | GPUs Needed | Status |
|---|---|---|---|
NVIDIA RTX 4090 (24 GB)Selected On-prem dev/inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A10G (24 GB) Inference & ML serving | 24 GB | 1× | Single GPU |
NVIDIA L4 (24 GB) Cost-efficient inference | 24 GB | 1× | Single GPU |
NVIDIA RTX 3090 (24 GB) Budget on-prem inference | 24 GB | 1× | Single GPU |
Apple M4 Pro (24 GB unified) Mac inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A100 40 GB Training medium models, inference | 40 GB | 1× | Single GPU |
NVIDIA L40S (48 GB) Inference, multi-modal workloads | 48 GB | 1× | Single GPU |
NVIDIA A40 (48 GB) Inference & fine-tuning | 48 GB | 1× | Single GPU |
Apple M4 Max (48 GB unified) Mac inference, light fine-tuning | 48 GB | 1× | Single GPU |
NVIDIA H100 / H100 PCIe (80 GB) LLM training & production inference | 80 GB | 1× | Single GPU |
NVIDIA A100 80 GB LLM fine-tuning & inference | 80 GB | 1× | Single GPU |
AMD MI250X (128 GB) Large-scale HPC & LLM training | 128 GB | 1× | Single GPU |
Apple M4 Ultra (128 GB unified) On-device Mac inference | 128 GB | 1× | Single GPU |
NVIDIA H200 SXM (141 GB) Largest LLM inference & training | 141 GB | 1× | Single GPU |
AMD MI300X (192 GB) Very large model inference & training | 192 GB | 1× | Single GPU |
NVIDIA RTX 3080 (10 GB) Small model inference only | 10 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4070 (12 GB) Light inference, LoRA tuning | 12 GB | 2× | 2× Multi-GPU |
NVIDIA V100 (16 GB) Legacy workloads | 16 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4080 (16 GB) Consumer dev, small inference | 16 GB | 2× | 2× Multi-GPU |
Por qué usar nuestra calculadora de VRAM
Planificar el hardware para LLM sin medir la memoria de GPU suele acabar en tarjetas sobredimensionadas o en errores de memoria insuficiente (OOM) en plena ejecución. Esta calculadora aplica la fórmula real de la VRAM en lugar de reglas aproximadas, de modo que puedes dimensionar GPUs con confianza antes de alquilar o comprar.
Elige entre los modos de inferencia, ajuste fino completo, entrenamiento LoRA y cuantización GGUF: cada modo aplica la fórmula correcta para esa carga de trabajo y actualiza al instante los pesos, la caché KV, los estados del optimizador y la sobrecarga del framework.
- Cálculos desde primeros principios: pesos, caché KV, activaciones, estados del optimizador, gradientes y sobrecarga del framework, no estimaciones a ojo.
- Totalmente privada: tus configuraciones se calculan en tu navegador y nunca se envían a ningún servidor.
- Modos de inferencia, ajuste fino, LoRA y GGUF, cada uno con su fórmula de VRAM específica.
- Tabla de compatibilidad con 19 GPU, incluidas H100, A100, RTX 4090, AMD MI300X y Apple Silicon.
Casos de uso habituales
Desde la selección de hardware hasta la planificación de entrenamientos, estos son los escenarios en los que una estimación fiable de VRAM ahorra tiempo y dinero.
- Elegir una GPU para inferencia de LLM: comprobar si un modelo de 70B cabe en una sola A100 de 80 GB o necesita dos GPU.
- Planificar ejecuciones de ajuste fino: el ajuste completo con Adam suele requerir de 3 a 6 veces la memoria de la inferencia.
- Optimizar la caché KV para contextos largos: ver cuánta VRAM adicional consume pasar de 4K a 32K o 128K tokens.
- Elegir la cuantización GGUF adecuada: comparar Q4, Q5 y Q8 y su equilibrio entre calidad y memoria.
- Ejecutar modelos en hardware de consumo: saber qué modelos cuantizados caben en 12, 16 o 24 GB de VRAM.
- Planificar el presupuesto de entrenamiento LoRA: ver cómo el rango elegido afecta a la memoria necesaria.
Cómo se calcula la VRAM y qué límites tiene
La VRAM es la memoria de la GPU, no la RAM del sistema: los pesos, la caché KV, las activaciones y los búferes del framework deben caber a la vez en ese presupuesto fijo. La cantidad necesaria depende del número de parámetros, la precisión numérica, la longitud de secuencia y el tamaño de lote, y del tipo de carga de trabajo (inferencia, entrenamiento o LoRA). Usamos las mismas fórmulas que aplican internamente vLLM, Transformers y llama.cpp.
La calculadora ofrece estimaciones de nivel de ingeniería, no medidas exactas: el uso real puede variar un ±10-20 % según el runtime, la implementación del modelo, la captura de grafos CUDA y la fragmentación de memoria. Todas las operaciones se ejecutan localmente en tu navegador.
- Indica los parámetros del modelo y la precisión: un modelo de 7B en FP16 ocupa unos 14 GB y en INT4 unos 3,5 GB.
- Añade la caché KV a partir de capas, cabezas KV, dimensión de cabeza, longitud de secuencia y lote; el GQA la reduce drásticamente.
- Para entrenamiento, suma gradientes y estados del optimizador Adam: unos 12 bytes extra por parámetro en el ajuste completo.
- Añade la sobrecarga del framework: reservamos un margen del 7 % para PyTorch, CUDA y la fragmentación de memoria.
Preguntas frecuentes
Una calculadora de VRAM estima la memoria de GPU necesaria para cargar y ejecutar un modelo de lenguaje grande. Calcula el almacenamiento de los pesos del modelo (parámetros × bytes por precisión), la caché KV (a partir de la longitud de secuencia, el tamaño de lote y la arquitectura de atención), las activaciones y, para el entrenamiento, los estados del optimizador y los gradientes. Funciona por completo en tu navegador y no sube ningún dato.
El número de parámetros suele aparecer en el nombre del modelo (7B, 70B, 405B). Para valores exactos, consulta el archivo config.json del modelo en Hugging Face y busca el campo "num_parameters". Nuestros presets incluyen recuentos precisos de parámetros para modelos populares como Llama 3.1, Qwen2.5, Mistral y Gemma 2.
Durante el ajuste fino completo, la GPU debe almacenar los pesos del modelo, tensores de gradiente del mismo tamaño y el estado del optimizador Adam (primer momento, segundo momento y pesos maestros en FP32), lo que añade unos 12 bytes extra por parámetro. Para un modelo de 7B en BF16, la inferencia necesita ~14 GB, pero el entrenamiento completo requiere ~60-80 GB.
La caché KV guarda las claves y valores de atención de todos los tokens anteriores. Su tamaño = 2 × capas × cabezas KV × dimensión de cabeza × longitud de secuencia × tamaño de lote × bytes. Crece de forma lineal con el contexto: pasar de 4K a 128K tokens la multiplica por 32. El GQA reduce las cabezas KV y recorta mucho su tamaño.
El modo GGUF calcula la memoria de los pesos como parámetros × (bits de cuantización / 8) bytes. La caché KV siempre se guarda en FP16, independientemente de la cuantización de los pesos. Q4_K_M (≈4 bits) es el equilibrio más popular entre calidad y eficiencia de memoria para usuarios de llama.cpp y Ollama.
El GQA reduce el número de cabezas de clave y valor a una fracción de las cabezas de consulta. Como la caché KV escala con las cabezas KV, el GQA puede reducirla 4 veces o más. Llama 3.1 usa 8 cabezas KV frente a 32 cabezas de consulta. Introduce num_key_value_heads desde config.json para obtener estimaciones precisas.
En FP16, un modelo de 70B requiere unos 140 GB solo para los pesos, y cabe en dos tarjetas H100 de 80 GB. En INT4 los pesos bajan a ~35 GB y caben en una sola H100. La tabla de compatibilidad de GPU muestra el número mínimo de GPU para cada tarjeta de tu configuración.
La calculadora usa la fórmula teórica estándar en la que se basan todos los runtimes. La atención paginada de vLLM puede añadir un 5-15 % de sobrecarga. llama.cpp mapea los pesos en memoria y puede ejecutar modelos mayores. El margen de sobrecarga del 7 % cubre la mayor parte de la variación entre runtimes. Valida siempre con una prueba pequeña antes de desplegar en producción.
Sí. La calculadora de VRAM se ejecuta por completo en tu navegador. Los parámetros de arquitectura, las precisiones y la configuración de contexto se procesan localmente en tu dispositivo y nunca se envían a ningún servidor. No hace falta cuenta ni registro.