Saltar al contenido
Aback Tools Logo

Calculadora de costes de infraestructura de IA

Estima gratis y online el gasto total de infraestructura de tus aplicaciones de IA. Modela el coste de tokens de API de LLM, cómputo con GPU, bases de datos vectoriales, almacenamiento, egreso de red, servidores de aplicación, observabilidad y más, con vistas mensuales y anuales, desglose de costes ordenado y un margen de contingencia personalizable.

AI Infrastructure Cost Calculator

Estimate total monthly and annual infrastructure expenses for your AI application - covering LLM APIs, GPU compute, storage, networking, orchestration, and observability.

LLM API Usage

$
$
Monthly LLM API cost$410.94

Embedding API

$
Monthly embedding cost$1.22

GPU / Self-Hosted Compute

×
$
hrs
Monthly GPU cost$0

Total AI Infrastructure Cost (Monthly)

$979.06= $11.7K/yr

Compute

$412.16

42.1%

Storage

$18.80

1.9%

Networking

$9.10

0.9%

Ops + Overhead

$539.01

55.1%

All Cost Components - Ranked by Spend

LLM API (Input)23.3%
$228.30
App Servers20.4%
$200.00
LLM API (Output)18.7%
$182.64
Orchestration10.2%
$100.00
Support10.2%
$100.00
Overhead / Contingency9.1%
$89.01
Monitoring5.1%
$50.00
Object Storage1.2%
$11.50
Egress0.9%
$9.00
Vector Database0.5%
$5.00
Database0.2%
$2.30
Embeddings API0.1%
$1.22
CDN0.0%
$0.10
Total Monthly$979.06

Compute (LLM + GPU)

$412.16/mo

Storage

$18.80/mo

Networking

$9.10/mo

Ops + Overhead

$539.01/mo

Overhead & Contingency

10%= $89.01/mo

Added to subtotal to cover unexpected usage spikes, support escalations, and untracked minor services.

Las capas de coste de una aplicación de IA

El coste de una app de IA no se limita a los tokens del LLM. Bases de datos vectoriales, cómputo, almacenamiento, egreso de red y observabilidad suman rápido, y suelen ser los conceptos que se olvidan en las estimaciones iniciales.

Recorre cada pestaña e introduce tus volúmenes reales de tokens, instancias, gigabytes y peticiones para obtener una imagen completa del gasto mensual y anual.

  • API de LLM: entrada y salida de tokens según el modelo y el volumen de peticiones.
  • Cómputo con GPU: horas de instancia y utilización para inferencia propia o entrenamiento.
  • Bases vectoriales y almacenamiento: vectores, índices, metadatos y cargas útiles.
  • Red: egreso de datos, CDN y transferencia entre zonas.
  • Servidores de aplicación, orquestación y observabilidad: el resto del stack operativo.

Cómo usar el desglose de costes

La herramienta ordena las categorías de mayor a menor gasto, así que empieza por las primeras para encontrar el mayor margen de optimización.

  1. Introduce el volumen de tokens y el modelo para calcular el gasto en API de LLM.
  2. Añade cómputo, bases vectoriales, almacenamiento, red y servidores de aplicación.
  3. Incluye la observabilidad y el margen de contingencia del 10-15 %.
  4. Revisa el desglose ordenado y las vistas mensual y anual para fijar el presupuesto.

Decidir entre API gestionada y autoalojamiento

El autoalojamiento de modelos puede abaratar mucho el coste por token cuando la utilización es alta y constante, pero sale caro si hay muchos periodos con la GPU ociosa. Compara ambos escenarios con tus propios volúmenes antes de decidir.

  • Con utilización de GPU por debajo del 60 %, las API gestionadas suelen salir más baratas.
  • Con caudal alto y estable, una GPU dedicada puede reducir el coste por token drásticamente.
  • Incluye el coste de ingeniería y mantenimiento del autoalojamiento, no solo la instancia.
  • Reserva un margen de contingencia para picos de tráfico o bots.

Preguntas frecuentes

Una calculadora de costes de infraestructura de IA estima el gasto recurrente total de ejecutar una aplicación de IA en todas las capas de infraestructura: API de LLM, API de embeddings, cómputo con GPU, bases de datos vectoriales, almacenamiento de objetos, bases de datos relacionales, CDN, egreso de red, servidores de aplicación, orquestación y observabilidad. Ayuda a desarrolladores y equipos de producto a proyectar presupuestos realistas antes de pasar a producción. Funciona íntegramente en tu navegador y no requiere registro.

El porcentaje de sobrecarga añade un margen de contingencia sobre los costes modelados para cubrir servicios menores no contabilizados, picos de uso inesperados (un momento viral o tráfico de bots), ajustes de precios de los proveedores, escalados de soporte y cargos diversos difíciles de prever. Un margen del 10-15 % es una buena práctica de ingeniería habitual en la estimación de costes cloud.

No. La calculadora funciona al 100 % en el lado del cliente, en tu navegador. Los volúmenes de tokens, el número de instancias, los tamaños de almacenamiento y todos los datos de coste se procesan localmente en tu dispositivo y nunca se envían a ningún servidor. Los datos de tu infraestructura son completamente privados y seguros.

La inferencia propia suele empezar a competir con las API gestionadas cuando la utilización de GPU supera de forma constante el 60-70 %. Con poca utilización pagas horas de GPU inactivas que el precio por API gestionada evita. A escala, con caudal constante, una sola A100 a 3 $/hora puede manejar volúmenes de tokens equivalentes mucho más baratos que el precio por token gestionado. Usa la pestaña de cómputo de la calculadora para comparar ambos escenarios con tus volúmenes concretos.

En un sistema RAG, los costes de embeddings provienen de dos fuentes: la ingesta inicial del corpus (vectorizar todos tus documentos) y la vectorización continua de consultas en tiempo de ejecución. Para los costes recurrentes, multiplica tu volumen diario de consultas por la longitud media de la consulta en tokens para obtener los tokens diarios de embedding y aplica la tarifa por millón de tokens de tu proveedor. text-embedding-3-small de OpenAI cuesta 0,02 $/M tokens, muy barato frente a los costes de generación del LLM.

Los costes de egreso varían mucho según el proveedor. AWS cobra ~0,09 $/GB de salida a internet, GCP ~0,08 $/GB y Azure ~0,087 $/GB. Cloudflare Workers y R2 no cobran egreso, lo que los hace atractivos como capa de caché. Las aplicaciones de IA que emiten respuestas largas o devuelven audio e imágenes sintetizadas pueden generar de 50 a 500 GB/mes de egreso a escala, algo que se nota rápido en proveedores tradicionales.

Una estimación aproximada: para 1 millón de documentos de 512 tokens cada uno con embeddings float32 de 1536 dimensiones, los vectores brutos ocupan unos 6 GB antes de la sobrecarga del índice HNSW (que añade un 10-30 %). Con metadatos y cargas útiles, calcula ~10 GB por millón de documentos. La cuantización int8 (compatible con Qdrant) lo reduce 4× y la binaria 32×, con ligeras pérdidas de recuperación.

En la mayoría de aplicaciones de IA los costes de CDN son mínimos comparados con las API de LLM y el cómputo. La CDN importa sobre todo para servir activos estáticos (frontend, documentación) y los grandes proveedores cobran entre 0,01 y 1,00 $ por millón de peticiones. Sin embargo, si tu aplicación entrega medios generados por IA (imágenes, audio, vídeo) vía CDN, los costes de almacenamiento y transferencia pueden volverse significativos según los volúmenes y tamaños de archivo.