Calculadora de costes de alojamiento de LLM
Calcula el coste de infraestructura de autoalojar un modelo de lenguaje grande, gratis y 100 % privado en tu navegador. Compara alquileres de GPU en la nube (RunPod, Vast.ai, Lambda Labs, AWS), inferencia serverless gestionada (Together AI, Groq, Fireworks AI, DeepInfra) y hardware propio para modelos abiertos populares como Llama 3.1, Mistral, Qwen, DeepSeek y Gemma. Incluye comprobación de compatibilidad de VRAM, dimensionado según cuantización, estimaciones de coste por petición y una tabla comparativa completa.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
Las tres formas de alojar un LLM
Autoalojar no significa una sola cosa: puedes alquilar GPU por horas, pagar inferencia gestionada por token o comprar hardware. Cada modelo de coste gana en un escenario distinto.
La elección depende sobre todo de la constancia de tu carga: una GPU alquilada cuesta lo mismo esté ocupada o no.
- Alquiler de GPU: tarifa horaria fija, tú gestionas el stack.
- Inferencia gestionada: pago por token, sin costes ociosos.
- Hardware propio: inversión inicial, coste por hora más bajo a largo plazo.
VRAM y cuantización
Antes de comparar precios, comprueba que el modelo cabe en la GPU que estás considerando. La cuantización es la palanca más directa para reducir la VRAM necesaria.
- FP16/BF16: 2 bytes por parámetro.
- INT8: la mitad de VRAM, pérdida de calidad mínima.
- INT4: un cuarto de VRAM, con un 1-5 % menos de calidad según benchmark.
Utilización y coste por petición
El precio por hora solo es la mitad de la historia. La utilización real determina cuánto de esa tarifa se convierte en trabajo útil.
- Estima tus tokens diarios y las peticiones por minuto en hora punta.
- Calcula la utilización esperada según tu patrón de tráfico.
- Divide el coste horario entre las peticiones realmente atendidas.
- Compara ese coste por petición con el de una API gestionada.
Preguntas frecuentes
Estima los gastos de infraestructura de ejecutar un modelo de lenguaje grande por tu cuenta: en GPU alquiladas en la nube, API de inferencia serverless gestionada o hardware propio. Ayuda a desarrolladores y equipos a comparar opciones de despliegue, calcular costes por petición y mensuales, comprobar requisitos de VRAM y decidir si autoalojar es más económico que usar API gestionadas. Nuestra calculadora funciona 100 % en tu navegador y no requiere registro.
El punto de equilibrio depende de tu volumen de peticiones y del modelo elegido. Con volumen bajo (menos de 500 000 tokens al día) las API gestionadas suelen ser más baratas porque evitas pagar GPU ociosas. Con volumen alto (más de 5 millones de tokens al día), el alquiler de GPU dedicada o el hardware propio suele costar 60-90 % menos por token que las API gestionadas para modelos abiertos equivalentes.
Llama 3.1 70B requiere aproximadamente 140 GB de VRAM en precisión FP16/BF16 (2× A100 80GB), unos 72 GB en INT8 (1× H100 80GB) y unos 40 GB con cuantización INT4 (1× A100 80GB). Nuestra calculadora muestra los requisitos de VRAM automáticamente al seleccionar un modelo y un nivel de cuantización, e indica qué opciones de despliegue son compatibles.
Es el porcentaje de tiempo en que la GPU está procesando realmente peticiones de inferencia durante las horas activas. Una utilización baja (20-30 %) significa que pagas cómputo ocioso, lo que eleva tu coste efectivo por petición. Una utilización alta (70-90 %) permite amortizar mejor la tarifa horaria entre más peticiones. Los servidores de inferencia en producción con batching continuo (vLLM, TGI) suelen alcanzar un 50-80 % de utilización con carga constante.
El alquiler de GPU en la nube (RunPod, Vast.ai, Lambda Labs, AWS) te da una GPU dedicada a tarifa horaria fija: instalas y gestionas tu propio stack de servicio. La inferencia gestionada (Together AI, Groq, Fireworks AI) se encarga de toda la infraestructura y cobra por token consumido, sin costes ociosos. El alquiler de GPU encaja mejor con cargas altas y constantes; la inferencia gestionada, con uso impredecible o de bajo volumen.
La cuantización reduce la precisión de los pesos de FP16 (2 bytes por parámetro) a INT8 (1 byte) o INT4 (0,5 bytes), recortando los requisitos de VRAM entre un 50 y un 75 %. Esto te permite ejecutar un modelo de 70B en hardware más barato o meter un modelo mayor en la misma GPU. La cuantización INT4 (GGUF Q4, AWQ, GPTQ) suele reducir la calidad un 1-5 % en la mayoría de benchmarks, algo aceptable para muchos casos de producción.
Se basan en cifras de benchmark publicadas para cada modelo en hardware H100 SXM, escaladas por número de GPU y utilización. El rendimiento real depende de tu framework de servicio (vLLM, TGI, Ollama), el tamaño de lote, la longitud de contexto y la configuración de hardware. Tómalas como estimaciones de orden de magnitud para planificar capacidad; un perfilado real dará cifras exactas para tu carga.
Sí. La calculadora funciona íntegramente en tu navegador con JavaScript del lado del cliente. Las selecciones de modelo, volúmenes de uso, costes de infraestructura y todos los resultados calculados se procesan localmente en tu dispositivo y nunca se transmiten a ningún servidor. No requiere cuenta y no se guarda ningún dato. Tu planificación de infraestructura queda totalmente privada y segura.