Saltar al contenido
Aback Tools Logo

Calculadora de costes de IA autoalojada

Compara el coste real de autoalojar LLM de código abierto frente a proveedores de API gestionadas, gratis y 100 % privado en tu navegador. Configura tu carga de trabajo, elige una opción de infraestructura de GPU (RunPod, Vast.ai, Lambda, AWS, GCP, hardware propio), añade la sobrecarga de DevOps y obtén una comparación mensual en paralelo, el coste por millón de tokens, la comprobación de capacidad de rendimiento y el periodo de equilibrio del hardware propio.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

El coste real va más allá del precio de la GPU

El alquiler por hora es solo la partida más visible. El tiempo de ingeniería, la red y el almacenamiento suelen añadir entre un 30 y un 60 % al coste bruto.

Comparar solo la tarifa de GPU con el precio por token de una API lleva a conclusiones equivocadas.

  • GPU: tarifa horaria × horas del mes.
  • DevOps: horas de ingeniería × coste cargado por hora.
  • Extras: red, almacenamiento y puesta en marcha del framework.

Utilización y cuantización

El coste efectivo por token depende tanto de la utilización como del precio por hora. Una GPU medio vacía duplica tu coste unitario.

  • Utilización baja = coste por token proporcionalmente mayor.
  • El batching y vLLM mejoran la utilización en producción.
  • INT4/Q4 recorta VRAM, permite modelos mayores en GPU más baratas.

Cuándo gana cada opción

La nube gana en cargas variables o proyecto corto. El hardware propio gana con uso alto y constante durante años.

  1. Estima tus tokens diarios y tu utilización sostenible.
  2. Calcula el coste mensual autoalojado con GPU y DevOps.
  3. Compáralo con el precio de la API gestionada para la misma carga.
  4. Si el uso es estable y alto, calcula la amortización del hardware propio a 3-4 años.

Preguntas frecuentes

Estima el coste mensual total de ejecutar LLM de código abierto en tu propia infraestructura de GPU, incluyendo el alquiler de GPU o el coste amortizado del hardware, la mano de obra de DevOps y la sobrecarga operativa, y lo compara con el precio de una API gestionada para la misma carga.

El punto de equilibrio depende de tu modelo, la eficiencia de la GPU y la sobrecarga de operaciones. Para modelos pequeños como Llama 3.1 8B, el autoalojamiento empieza a ser competitivo en torno a 500 000-2 millones de tokens al día. Para modelos de 70B, el equilibrio suele estar entre 5 y 20 millones de tokens al día.

La tarifa horaria de la GPU es solo una parte del coste real. El tiempo de ingeniería de DevOps (500-3 000 $/mes), la red, el almacenamiento y la puesta en marcha del framework de servicio añaden un 30-60 % sobre el coste bruto de GPU. Inclúyelos siempre al comparar con el precio de una API.

Es el porcentaje de cómputo de GPU que está procesando peticiones activamente. Con un 30 % de utilización, tu coste efectivo por token es 3× mayor que con un 90 %. El batching de peticiones y frameworks como vLLM son clave para lograr una utilización alta y que el autoalojamiento sea económicamente competitivo.

La cuantización (INT4/Q4) reduce los requisitos de VRAM en torno a un 70 %, permitiendo modelos mayores en GPU más baratas. La contrapartida es una reducción de rendimiento del 10-20 % y una degradación leve de la calidad. Para la mayoría de cargas de inferencia en producción, es un buen intercambio cuando la VRAM es el cuello de botella.

Para un despliegue sencillo de un solo modelo en la nube, presupuesta entre 5 y 20 horas al mes de tiempo de ingeniero. A una tarifa cargada de 80-150 $/h, eso son 400-3 000 $/mes. Usa 10-20 horas al mes al principio y registra el tiempo real durante el primer trimestre para afinar tu proyección.

Sí. La calculadora funciona íntegramente en tu navegador. Los volúmenes de carga, las elecciones de infraestructura y todos los resultados se procesan localmente en tu dispositivo y nunca se envían a ningún servidor, ni se almacenan ni se comparten. No requiere inicio de sesión.

Para modelos pequeños de bajo coste: Vast.ai (~0,35 $/h RTX 4090) y RunPod (~0,44 $/h L4). Para inferencia en producción de 7-13B: RunPod o Lambda (A10G/A100 a 0,76-1,64 $/h). Para modelos de 70B o más: RunPod H100 (3,49 $/h). Para cargas estables y eficientes en coste: hardware propio amortizado a 3-4 años.