Calculadora de costes de inferencia
Estima gratis y online los gastos de inferencia LLM a partir de peticiones, latencia y volúmenes de tokens. Modela descuentos de caché de prompts, ahorro de la Batch API, sobrecarga de reintentos y capacidad de rendimiento concurrente; después compara costes y latencia entre 14 modelos. Funciona 100 % en tu navegador.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
Qué entra en el coste de inferencia
El coste de inferencia depende del número de peticiones, del tamaño de entrada y salida de cada una y del modelo elegido. La combinación de estos tres factores cambia por completo el resultado.
Como los tokens de salida cuestan más que los de entrada, una respuesta larga y un prompt corto pueden costar más que al revés.
- Peticiones diarias × coste por petición = gasto base diario.
- Tokens de salida más caros: vigila la longitud de las respuestas.
- La latencia objetivo influye en el modelo que puedes permitirte.
Descuentos de caché y lotes
La caché de prompts y la Batch API son las dos palancas principales para bajar la factura sin degradar la calidad. Cada una encaja con patrones de tráfico distintos.
- Caché de prompts: útil con un system prompt o contexto grande y repetido.
- Batch API: en torno al 50 % de descuento para trabajos asíncronos.
- Reintentos: suma proporcionalmente al volumen y al coste total.
Comprobar el SLA de latencia
Un coste bajo no sirve si la experiencia se degrada. La latencia estimada se obtiene del TTFT más el tiempo de generación de los tokens de salida.
- Define el TTFT y la velocidad de generación del modelo que evalúas.
- Calcula la latencia de extremo a extremo con tu tamaño de salida típico.
- Compara el resultado con tu objetivo de SLA.
- Si falla, cambia a un modelo más rápido o reduce la longitud de salida.
Preguntas frecuentes
Estima cuánto pagas por ejecutar peticiones LLM en vivo a una escala determinada. Toma tu recuento de tokens de entrada y de salida, el volumen diario de peticiones y la selección de modelo para proyectar el coste por petición y el total diario, mensual o anual. Además modela el cumplimiento del SLA de latencia, la capacidad de rendimiento, la caché de prompts, los descuentos de la Batch API y la sobrecarga de reintentos, todo localmente en tu navegador y sin registro.
El coste de entrenamiento es un gasto único para construir o ajustar un modelo con cómputo de GPU. El coste de inferencia es el gasto recurrente por petición que pagas cada vez que un usuario o un proceso envía un prompt y recibe una respuesta. En la mayoría de aplicaciones en producción, la inferencia domina el gasto continuo de IA: escala directamente con tu base de usuarios y el volumen de peticiones.
Sí. La calculadora se ejecuta íntegramente en el lado del cliente, en tu navegador, con JavaScript. Los tamaños de tokens, volúmenes de peticiones, objetivos de latencia y proyecciones de coste se procesan localmente en tu dispositivo y nunca se transmiten a ningún servidor ni se almacenan. Tus datos permanecen 100 % privados durante toda la sesión.
La latencia de extremo a extremo se estima como: tiempo hasta el primer token (TTFT) + (tokens de salida ÷ velocidad de generación en tokens/s). Por ejemplo, un modelo con 300 ms de TTFT que genera 500 tokens a 100 tokens/s tiene una latencia estimada de 300 ms + 5.000 ms = 5,3 segundos. Los valores de TTFT y velocidad son medianas representativas; los resultados reales varían según la región del proveedor, la carga del servidor y el tamaño de la petición.
El TTFT es el tiempo entre enviar una petición y recibir el primer token de la respuesta. Determina con qué rapidez tu aplicación puede empezar a mostrar resultados al usuario. Un TTFT bajo (menos de 200 ms) es crítico para aplicaciones de chat interactivas. Los modelos más pequeños y más cuantizados suelen tener TTFT más bajo que los grandes modelos frontera.
La caché de prompts guarda el estado de atención KV de un prefijo de prompt repetido, de modo que las peticiones posteriores que usan el mismo prefijo se cobran a aproximadamente el 25 % de la tarifa de entrada estándar. Es muy eficaz cuando tu prompt de sistema o contexto de documento es grande y se comparte entre muchas peticiones.
Usa la Batch API para cargas que no dependen de la latencia: resumen masivo de documentos, enriquecimiento de datos offline, clasificación a gran escala y generación nocturna de informes. La Batch API cobra aproximadamente el 50 % de la tarifa estándar en tiempo real. La inferencia en tiempo real es imprescindible para cualquier función interactiva de cara al usuario.
Una tasa del 2-5 % es habitual en cargas de API LLM en producción, contando errores de límite de tasa, tiempos de espera transitorios y errores 5xx del proveedor. Las aplicaciones de alto rendimiento que llaman con frecuencia cerca de los límites pueden ver tasas de reintento del 5-15 %. La tasa de reintentos se suma proporcionalmente a tu número total de peticiones y al coste.