Calculadora de costes de IA autoalojada
Compara el coste real de autoalojar LLM de código abierto frente a proveedores de API gestionadas, gratis y 100 % privado en tu navegador. Configura tu carga de trabajo, elige una opción de infraestructura de GPU (RunPod, Vast.ai, Lambda, AWS, GCP, hardware propio), añade la sobrecarga de DevOps y obtén una comparación mensual en paralelo, el coste por millón de tokens, la comprobación de capacidad de rendimiento y el periodo de equilibrio del hardware propio.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
El coste real va más allá del precio de la GPU
El alquiler por hora es solo la partida más visible. El tiempo de ingeniería, la red y el almacenamiento suelen añadir entre un 30 y un 60 % al coste bruto.
Comparar solo la tarifa de GPU con el precio por token de una API lleva a conclusiones equivocadas.
- GPU: tarifa horaria × horas del mes.
- DevOps: horas de ingeniería × coste cargado por hora.
- Extras: red, almacenamiento y puesta en marcha del framework.
Utilización y cuantización
El coste efectivo por token depende tanto de la utilización como del precio por hora. Una GPU medio vacía duplica tu coste unitario.
- Utilización baja = coste por token proporcionalmente mayor.
- El batching y vLLM mejoran la utilización en producción.
- INT4/Q4 recorta VRAM, permite modelos mayores en GPU más baratas.
Cuándo gana cada opción
La nube gana en cargas variables o proyecto corto. El hardware propio gana con uso alto y constante durante años.
- Estima tus tokens diarios y tu utilización sostenible.
- Calcula el coste mensual autoalojado con GPU y DevOps.
- Compáralo con el precio de la API gestionada para la misma carga.
- Si el uso es estable y alto, calcula la amortización del hardware propio a 3-4 años.
Preguntas frecuentes
Estima el coste mensual total de ejecutar LLM de código abierto en tu propia infraestructura de GPU, incluyendo el alquiler de GPU o el coste amortizado del hardware, la mano de obra de DevOps y la sobrecarga operativa, y lo compara con el precio de una API gestionada para la misma carga.
El punto de equilibrio depende de tu modelo, la eficiencia de la GPU y la sobrecarga de operaciones. Para modelos pequeños como Llama 3.1 8B, el autoalojamiento empieza a ser competitivo en torno a 500 000-2 millones de tokens al día. Para modelos de 70B, el equilibrio suele estar entre 5 y 20 millones de tokens al día.
La tarifa horaria de la GPU es solo una parte del coste real. El tiempo de ingeniería de DevOps (500-3 000 $/mes), la red, el almacenamiento y la puesta en marcha del framework de servicio añaden un 30-60 % sobre el coste bruto de GPU. Inclúyelos siempre al comparar con el precio de una API.
Es el porcentaje de cómputo de GPU que está procesando peticiones activamente. Con un 30 % de utilización, tu coste efectivo por token es 3× mayor que con un 90 %. El batching de peticiones y frameworks como vLLM son clave para lograr una utilización alta y que el autoalojamiento sea económicamente competitivo.
La cuantización (INT4/Q4) reduce los requisitos de VRAM en torno a un 70 %, permitiendo modelos mayores en GPU más baratas. La contrapartida es una reducción de rendimiento del 10-20 % y una degradación leve de la calidad. Para la mayoría de cargas de inferencia en producción, es un buen intercambio cuando la VRAM es el cuello de botella.
Para un despliegue sencillo de un solo modelo en la nube, presupuesta entre 5 y 20 horas al mes de tiempo de ingeniero. A una tarifa cargada de 80-150 $/h, eso son 400-3 000 $/mes. Usa 10-20 horas al mes al principio y registra el tiempo real durante el primer trimestre para afinar tu proyección.
Sí. La calculadora funciona íntegramente en tu navegador. Los volúmenes de carga, las elecciones de infraestructura y todos los resultados se procesan localmente en tu dispositivo y nunca se envían a ningún servidor, ni se almacenan ni se comparten. No requiere inicio de sesión.
Para modelos pequeños de bajo coste: Vast.ai (~0,35 $/h RTX 4090) y RunPod (~0,44 $/h L4). Para inferencia en producción de 7-13B: RunPod o Lambda (A10G/A100 a 0,76-1,64 $/h). Para modelos de 70B o más: RunPod H100 (3,49 $/h). Para cargas estables y eficientes en coste: hardware propio amortizado a 3-4 años.