Calculadora de coste de prompts
Estima gratis y online el coste de ejecutar prompts a escala. Define el prompt de sistema, el mensaje de usuario y los tokens de salida, y establece tu volumen diario de peticiones para ver los costes de API proyectados en periodos diarios, mensuales y anuales. Compara costes entre 13 proveedores importantes de LLM al instante. Rápido, privado y 100 % en el navegador.
Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.
Support chatbot with system prompt + short user messages
Prompt Composition (per request)
Token Breakdown per Request
Scale & Model
Projected Monthly Cost - GPT-4o mini
Cost / Request
$0.000322
Cost / Day
$1.61
Input Token Cost
$21.38
Output Token Cost
$27.00
Cost at Scale - All Periods
| Period | Total Requests | Input Cost | Output Cost | Total Cost |
|---|---|---|---|---|
| Daily | 5,000 | $0.7125 | $0.9000 | $1.61 |
| MonthlySelected | 150,000 | $21.38 | $27.00 | $48.38 |
| Yearly | 1,825,000 | $260.06 | $328.50 | $588.56 |
Cross-Model Price Comparison
Sorted by lowest monthly cost| Model | In/1M | Out/1M | Cost/Req | Monthly Total |
|---|---|---|---|---|
Mistral Small(Mistral)Budget | $0.10 | $0.30 | $0.000185 | $27.75 |
GPT-4o mini(OpenAI)Budget Active | $0.15 | $0.60 | $0.000322 | $48.37 |
DeepSeek-V3(DeepSeek)Budget | $0.27 | $1.10 | $0.000586 | $87.98 |
Gemini 2.5 Flash(Google)Budget | $0.30 | $2.50 | $0.001035 | $155.25 |
Grok 4.3(xAI) | $1.25 | $2.50 | $0.001937 | $290.63 |
Claude 3.5 Haiku(Anthropic)Budget | $0.80 | $4.00 | $0.001960 | $294.00 |
o4-mini(OpenAI)Budget | $1.10 | $4.40 | $0.002365 | $354.75 |
Mistral Large(Mistral) | $2.00 | $6.00 | $0.003700 | $555.00 |
Gemini 2.5 Pro(Google) | $1.25 | $10.00 | $0.004187 | $628.12 |
o3(OpenAI) | $2.00 | $8.00 | $0.004300 | $645.00 |
GPT-4o(OpenAI) | $2.50 | $10.00 | $0.005375 | $806.25 |
Claude Sonnet 4.6(Anthropic)Powerful | $3.00 | $15.00 | $0.007350 | $1,102.50 |
Claude 3 Opus(Anthropic)Powerful | $15.00 | $75.00 | $0.0367 | $5,512.50 |
Click any row to select that model.
Por qué el prompt de sistema domina la factura
El prompt de sistema se envía completo en cada petición. Su coste no depende de lo útil que sea, sino del número de peticiones que hagas.
Con volúmenes altos, recortar unos cientos de tokens del prompt de sistema supone un ahorro muy significativo al mes.
- Coste del prompt de sistema = tokens × peticiones diarias × días.
- Los tokens de salida cuestan 3-6× más que los de entrada.
- La caché de prompts reduce ese coste un 75-90 % cuando aplica.
Desglose entre mensaje de usuario y contexto
Separa lo que es contexto fijo de lo que cambia en cada petición. Solo la parte fija es candidata a caché.
- Mide los tokens de tu prompt de sistema y de tu mensaje de usuario por separado.
- Suma los tokens de entrada previstos por petición.
- Añade los tokens de salida esperados por respuesta.
- Multiplica por tu volumen de peticiones para ver el total del periodo.
Elegir modelo y proyectar crecimiento
Compara el coste total de tu configuración exacta entre modelos antes de comprometerte. El modelo más barato que cumpla tus requisitos de calidad es casi siempre la mejor elección.
- Empieza por el modelo más económico y sube solo si la calidad no basta.
- Modela el crecimiento mensual para no quedarte corto en el presupuesto.
- Reserva los modelos frontera para razonamiento complejo.
Preguntas frecuentes
Estima el gasto de API de ejecutar una configuración de prompt concreta (tu prompt de sistema, el mensaje de usuario y la salida esperada) para un volumen de peticiones y un periodo determinados. Ayuda a desarrolladores y equipos de producto a conocer sus costes de API LLM antes de lanzar, planificar niveles de precios de SaaS de IA y comparar qué modelo ofrece la mejor relación coste-calidad para su carga.
Regla aproximada: 1 token ≈ 4 caracteres o unas 0,75 palabras en inglés. Un prompt de sistema de 500 palabras son unos 650-700 tokens. Un mensaje de usuario corto de 50 palabras ronda los 65-70 tokens. Para recuentos precisos, usa un tokenizador: Tiktoken de OpenAI y el tokenizador de Claude de Anthropic están disponibles como herramientas de código abierto. Nuestra herramienta Token Counter también puede estimar tokens a partir de texto pegado.
El prompt de sistema se cobra completo en cada petición a la API. Si tu prompt de sistema tiene 1.000 tokens y haces 10.000 peticiones al día, eso son 10 millones de tokens de entrada solo por el prompt de sistema, cada día. Por eso los prompts de sistema largos y verbosos inflan el coste a escala. Recortar el prompt de sistema y activar la caché de prompts son las dos optimizaciones con mejor retorno en la mayoría de aplicaciones LLM en producción.
No: la calculadora de coste de prompts usa tarifas estándar de pago por uso sin aplicar caché. Esto te da intencionadamente la línea base del peor caso. En la práctica, proveedores como OpenAI, Anthropic, Google y xAI ofrecen caché de prompts que reduce el coste de los tokens de entrada un 75-90 % en contenido estático repetido como los prompts de sistema. Usa esta herramienta para fijar tu línea base y luego modela el ahorro de caché aparte.
Usa la tabla comparativa entre modelos de la calculadora: muestra el coste total de tu configuración exacta en todos los modelos compatibles. Empieza por el modelo más barato que cumpla tu nivel de calidad. Tareas como clasificación, extracción y salida estructurada suelen funcionar muy bien con modelos pequeños (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Reserva los modelos frontera caros para tareas que realmente exijan razonamiento profundo.
El campo de tasa de crecimiento mensual modela el aumento del volumen de peticiones durante el periodo de previsión. Si introduces 20 %, la calculadora supone que tu número de peticiones diarias crece un 20 % cada mes. Para una previsión anual, usa interpolación lineal entre el volumen inicial y el final proyectado para calcular las peticiones y el coste totales. Ponlo a 0 para proyecciones planas.
Generar tokens requiere que el modelo ejecute un paso forward autorregresivo completo por cada token, mucho más cómputo que leer tokens de entrada. La generación de tokens de salida es computacionalmente más costosa y se factura con un recargo de 3-6× sobre los tokens de entrada en la mayoría de proveedores. Por eso las aplicaciones con respuestas largas tienen un perfil de coste distinto al de los clasificadores de salida corta.
Sí. La calculadora de coste de prompts funciona íntegramente en el lado del cliente, en tu navegador. Ningún recuento de tokens, configuración de prompt, estimación de coste o selección de modelo se envía a ningún servidor. Todo se calcula localmente en tu dispositivo y no se almacena. Los datos de tu planificación son 100 % privados y seguros.