Saltar al contenido
Aback Tools Logo

Calculadora de costes de inferencia

Estima gratis y online los gastos de inferencia LLM a partir de peticiones, latencia y volúmenes de tokens. Modela descuentos de caché de prompts, ahorro de la Batch API, sobrecarga de reintentos y capacidad de rendimiento concurrente; después compara costes y latencia entre 14 modelos. Funciona 100 % en tu navegador.

Inference Cost Calculator

Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.

Real-time user-facing chat with sub-2s latency SLA

In/1M: $0.15Out/1M: $0.60TTFT: 250msSpeed: 100 tok/s

Token Sizes per Request

tokens
tokens
Total/req: 1,150 tokensIn cost: $0.000120Out cost: $0.000210

Request Volume & Latency

req/day
concurrent
ms

Cost Optimizations

%
%
%
⚠️ SLA Risk: Estimated P95 latency for GPT-4o mini is 3.8s - exceeds your 1.5s target. Consider a faster model or reduce output tokens.

Projected Monthly Inference Cost

$201.96for 612,000 requests

Cost / Request

$0.000330

Cost / 1K Req

$0.3300

Est. Latency

3.8s

Max RPS

13.3

Per-Request Cost Breakdown

Input (standard): $0.000120Input (cached): $0.00Output: $0.000210Retry overhead: $0.00000660

Model Cost & Latency Comparison

Sorted by lowest monthly cost
Model$/reqMonthly CostLatencySLA
Llama 3.1 8BBudget
Groq/Together · 600 tok/s · TTFT 80ms
$0.00006800$41.62663ms✓ Met
Mistral Small 3.2Budget
Mistral · 160 tok/s · TTFT 160ms
$0.000185$113.222.3s✗ Breach
GPT-4o miniBudget Selected
OpenAI · 100 tok/s · TTFT 250ms
$0.000330$201.963.8s✗ Breach
DeepSeek-V3Budget
DeepSeek · 90 tok/s · TTFT 300ms
$0.000601$367.814.2s✗ Breach
Llama 3.3 70BBudget
Groq/Togther · 250 tok/s · TTFT 120ms
$0.000749$458.081.5s✗ Breach
Gemini 2.5 FlashBudget
Google · 150 tok/s · TTFT 180ms
$0.001115$682.382.5s✗ Breach
Grok 4.3
xAI · 80 tok/s · TTFT 350ms
$0.001875$1,147.504.7s✗ Breach
Claude 3.5 HaikuBudget
Anthropic · 130 tok/s · TTFT 200ms
$0.002040$1,248.482.9s✗ Breach
o4-mini
OpenAI · 50 tok/s · TTFT 600ms
$0.002420$1,481.047.6s✗ Breach
Mistral Large 3
Mistral · 70 tok/s · TTFT 380ms
$0.003700$2,264.405.4s✗ Breach
o3Capable
OpenAI · 45 tok/s · TTFT 700ms
$0.004400$2,692.808.5s✗ Breach
Gemini 2.5 Pro
Google · 65 tok/s · TTFT 450ms
$0.004500$2,754.005.8s✗ Breach
GPT-4oCapable
OpenAI · 60 tok/s · TTFT 400ms
$0.005500$3,366.006.2s✗ Breach
Claude Sonnet 4.6Capable
Anthropic · 55 tok/s · TTFT 500ms
$0.007650$4,681.806.9s✗ Breach
Disclaimer:Pricing uses standard Pay-As-You-Go rates. Latency estimates are indicative medians - actual TTFT and throughput vary by region, load, and request size. Batch API discounts are typically ~50% but differ by provider. Always verify rates on each provider's official pricing page. All calculations run locally in your browser; no data is sent to any server.

Qué entra en el coste de inferencia

El coste de inferencia depende del número de peticiones, del tamaño de entrada y salida de cada una y del modelo elegido. La combinación de estos tres factores cambia por completo el resultado.

Como los tokens de salida cuestan más que los de entrada, una respuesta larga y un prompt corto pueden costar más que al revés.

  • Peticiones diarias × coste por petición = gasto base diario.
  • Tokens de salida más caros: vigila la longitud de las respuestas.
  • La latencia objetivo influye en el modelo que puedes permitirte.

Descuentos de caché y lotes

La caché de prompts y la Batch API son las dos palancas principales para bajar la factura sin degradar la calidad. Cada una encaja con patrones de tráfico distintos.

  • Caché de prompts: útil con un system prompt o contexto grande y repetido.
  • Batch API: en torno al 50 % de descuento para trabajos asíncronos.
  • Reintentos: suma proporcionalmente al volumen y al coste total.

Comprobar el SLA de latencia

Un coste bajo no sirve si la experiencia se degrada. La latencia estimada se obtiene del TTFT más el tiempo de generación de los tokens de salida.

  1. Define el TTFT y la velocidad de generación del modelo que evalúas.
  2. Calcula la latencia de extremo a extremo con tu tamaño de salida típico.
  3. Compara el resultado con tu objetivo de SLA.
  4. Si falla, cambia a un modelo más rápido o reduce la longitud de salida.

Preguntas frecuentes

Estima cuánto pagas por ejecutar peticiones LLM en vivo a una escala determinada. Toma tu recuento de tokens de entrada y de salida, el volumen diario de peticiones y la selección de modelo para proyectar el coste por petición y el total diario, mensual o anual. Además modela el cumplimiento del SLA de latencia, la capacidad de rendimiento, la caché de prompts, los descuentos de la Batch API y la sobrecarga de reintentos, todo localmente en tu navegador y sin registro.

El coste de entrenamiento es un gasto único para construir o ajustar un modelo con cómputo de GPU. El coste de inferencia es el gasto recurrente por petición que pagas cada vez que un usuario o un proceso envía un prompt y recibe una respuesta. En la mayoría de aplicaciones en producción, la inferencia domina el gasto continuo de IA: escala directamente con tu base de usuarios y el volumen de peticiones.

Sí. La calculadora se ejecuta íntegramente en el lado del cliente, en tu navegador, con JavaScript. Los tamaños de tokens, volúmenes de peticiones, objetivos de latencia y proyecciones de coste se procesan localmente en tu dispositivo y nunca se transmiten a ningún servidor ni se almacenan. Tus datos permanecen 100 % privados durante toda la sesión.

La latencia de extremo a extremo se estima como: tiempo hasta el primer token (TTFT) + (tokens de salida ÷ velocidad de generación en tokens/s). Por ejemplo, un modelo con 300 ms de TTFT que genera 500 tokens a 100 tokens/s tiene una latencia estimada de 300 ms + 5.000 ms = 5,3 segundos. Los valores de TTFT y velocidad son medianas representativas; los resultados reales varían según la región del proveedor, la carga del servidor y el tamaño de la petición.

El TTFT es el tiempo entre enviar una petición y recibir el primer token de la respuesta. Determina con qué rapidez tu aplicación puede empezar a mostrar resultados al usuario. Un TTFT bajo (menos de 200 ms) es crítico para aplicaciones de chat interactivas. Los modelos más pequeños y más cuantizados suelen tener TTFT más bajo que los grandes modelos frontera.

La caché de prompts guarda el estado de atención KV de un prefijo de prompt repetido, de modo que las peticiones posteriores que usan el mismo prefijo se cobran a aproximadamente el 25 % de la tarifa de entrada estándar. Es muy eficaz cuando tu prompt de sistema o contexto de documento es grande y se comparte entre muchas peticiones.

Usa la Batch API para cargas que no dependen de la latencia: resumen masivo de documentos, enriquecimiento de datos offline, clasificación a gran escala y generación nocturna de informes. La Batch API cobra aproximadamente el 50 % de la tarifa estándar en tiempo real. La inferencia en tiempo real es imprescindible para cualquier función interactiva de cara al usuario.

Una tasa del 2-5 % es habitual en cargas de API LLM en producción, contando errores de límite de tasa, tiempos de espera transitorios y errores 5xx del proveedor. Las aplicaciones de alto rendimiento que llaman con frecuencia cerca de los límites pueden ver tasas de reintento del 5-15 %. La tasa de reintentos se suma proporcionalmente a tu número total de peticiones y al coste.