Saltar al contenido
Aback Tools Logo

Calculadora de costes de alojamiento de LLM

Calcula el coste de infraestructura de autoalojar un modelo de lenguaje grande, gratis y 100 % privado en tu navegador. Compara alquileres de GPU en la nube (RunPod, Vast.ai, Lambda Labs, AWS), inferencia serverless gestionada (Together AI, Groq, Fireworks AI, DeepInfra) y hardware propio para modelos abiertos populares como Llama 3.1, Mistral, Qwen, DeepSeek y Gemma. Incluye comprobación de compatibilidad de VRAM, dimensionado según cuantización, estimaciones de coste por petición y una tabla comparativa completa.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

Las tres formas de alojar un LLM

Autoalojar no significa una sola cosa: puedes alquilar GPU por horas, pagar inferencia gestionada por token o comprar hardware. Cada modelo de coste gana en un escenario distinto.

La elección depende sobre todo de la constancia de tu carga: una GPU alquilada cuesta lo mismo esté ocupada o no.

  • Alquiler de GPU: tarifa horaria fija, tú gestionas el stack.
  • Inferencia gestionada: pago por token, sin costes ociosos.
  • Hardware propio: inversión inicial, coste por hora más bajo a largo plazo.

VRAM y cuantización

Antes de comparar precios, comprueba que el modelo cabe en la GPU que estás considerando. La cuantización es la palanca más directa para reducir la VRAM necesaria.

  • FP16/BF16: 2 bytes por parámetro.
  • INT8: la mitad de VRAM, pérdida de calidad mínima.
  • INT4: un cuarto de VRAM, con un 1-5 % menos de calidad según benchmark.

Utilización y coste por petición

El precio por hora solo es la mitad de la historia. La utilización real determina cuánto de esa tarifa se convierte en trabajo útil.

  1. Estima tus tokens diarios y las peticiones por minuto en hora punta.
  2. Calcula la utilización esperada según tu patrón de tráfico.
  3. Divide el coste horario entre las peticiones realmente atendidas.
  4. Compara ese coste por petición con el de una API gestionada.

Preguntas frecuentes

Estima los gastos de infraestructura de ejecutar un modelo de lenguaje grande por tu cuenta: en GPU alquiladas en la nube, API de inferencia serverless gestionada o hardware propio. Ayuda a desarrolladores y equipos a comparar opciones de despliegue, calcular costes por petición y mensuales, comprobar requisitos de VRAM y decidir si autoalojar es más económico que usar API gestionadas. Nuestra calculadora funciona 100 % en tu navegador y no requiere registro.

El punto de equilibrio depende de tu volumen de peticiones y del modelo elegido. Con volumen bajo (menos de 500 000 tokens al día) las API gestionadas suelen ser más baratas porque evitas pagar GPU ociosas. Con volumen alto (más de 5 millones de tokens al día), el alquiler de GPU dedicada o el hardware propio suele costar 60-90 % menos por token que las API gestionadas para modelos abiertos equivalentes.

Llama 3.1 70B requiere aproximadamente 140 GB de VRAM en precisión FP16/BF16 (2× A100 80GB), unos 72 GB en INT8 (1× H100 80GB) y unos 40 GB con cuantización INT4 (1× A100 80GB). Nuestra calculadora muestra los requisitos de VRAM automáticamente al seleccionar un modelo y un nivel de cuantización, e indica qué opciones de despliegue son compatibles.

Es el porcentaje de tiempo en que la GPU está procesando realmente peticiones de inferencia durante las horas activas. Una utilización baja (20-30 %) significa que pagas cómputo ocioso, lo que eleva tu coste efectivo por petición. Una utilización alta (70-90 %) permite amortizar mejor la tarifa horaria entre más peticiones. Los servidores de inferencia en producción con batching continuo (vLLM, TGI) suelen alcanzar un 50-80 % de utilización con carga constante.

El alquiler de GPU en la nube (RunPod, Vast.ai, Lambda Labs, AWS) te da una GPU dedicada a tarifa horaria fija: instalas y gestionas tu propio stack de servicio. La inferencia gestionada (Together AI, Groq, Fireworks AI) se encarga de toda la infraestructura y cobra por token consumido, sin costes ociosos. El alquiler de GPU encaja mejor con cargas altas y constantes; la inferencia gestionada, con uso impredecible o de bajo volumen.

La cuantización reduce la precisión de los pesos de FP16 (2 bytes por parámetro) a INT8 (1 byte) o INT4 (0,5 bytes), recortando los requisitos de VRAM entre un 50 y un 75 %. Esto te permite ejecutar un modelo de 70B en hardware más barato o meter un modelo mayor en la misma GPU. La cuantización INT4 (GGUF Q4, AWQ, GPTQ) suele reducir la calidad un 1-5 % en la mayoría de benchmarks, algo aceptable para muchos casos de producción.

Se basan en cifras de benchmark publicadas para cada modelo en hardware H100 SXM, escaladas por número de GPU y utilización. El rendimiento real depende de tu framework de servicio (vLLM, TGI, Ollama), el tamaño de lote, la longitud de contexto y la configuración de hardware. Tómalas como estimaciones de orden de magnitud para planificar capacidad; un perfilado real dará cifras exactas para tu carga.

Sí. La calculadora funciona íntegramente en tu navegador con JavaScript del lado del cliente. Las selecciones de modelo, volúmenes de uso, costes de infraestructura y todos los resultados calculados se procesan localmente en tu dispositivo y nunca se transmiten a ningún servidor. No requiere cuenta y no se guarda ningún dato. Tu planificación de infraestructura queda totalmente privada y segura.