Calculadora de costes de Vertex AI
Calcula gratis y online los gastos de los modelos de Google Vertex AI. Estima costes de tokens en los modelos Gemini, Claude, Llama y Mistral con descuentos de caché de contexto, ahorro de Batch Prediction, pesos multimodales de tokens y previsiones mensuales. Totalmente privado: funciona en tu navegador.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Qué modelos puedes facturar en Vertex AI
Vertex AI no sirve solo modelos de Google: su Model Garden incluye Gemini, Claude, Llama y Mistral, cada uno con sus propias tarifas por token.
Elegir la familia correcta importa más que optimizar tokens en el margen.
- Gemini: caché de contexto y precios por token propios de Google.
- Claude, Llama y Mistral: tarifas de terceros dentro de la plataforma.
- Batch Prediction aplica un 50 % de descuento a todos los modelos compatibles.
Caché de contexto y Batch Prediction
La caché de contexto es la mayor palanca cuando reutilizas un contexto grande y estable. Solo está disponible en los modelos Gemini.
- Tokens en caché: en torno al 25 % de la tarifa de entrada.
- Batch Prediction: cerca del 50 % de descuento, con 24 h de latencia.
- Combina ambas cuando el contexto es estable y la latencia no crítica.
Entradas multimodales y planificación
Las imágenes, el audio y el vídeo se convierten en tokens antes de facturar, así que conviene estimar su impacto en el coste total.
- Define los tokens de entrada y salida por petición.
- Elige el modelo y activa la caché si aplica.
- Si hay medios, estima sus tokens con el conversor multimodal.
- Revisa la previsión mensual antes de fijar el presupuesto.
Preguntas frecuentes
Es una herramienta que estima los gastos de inferencia de modelos de Google Cloud Vertex AI según tus tokens de entrada y salida, el volumen de peticiones y el modelo elegido. Cubre los modelos Gemini, Claude, Llama y Mistral disponibles en la plataforma. Nuestra calculadora funciona íntegramente en tu navegador y no requiere registro.
Google AI Studio se orienta a desarrolladores individuales con una facturación más sencilla, mientras que Vertex AI es la plataforma empresarial con integración completa de Google Cloud, controles IAM, soporte VPC-SC y SLA. Para los modelos Gemini, el precio por token es idéntico en ambas plataformas. La diferencia clave es que Vertex AI también ofrece modelos de terceros (Claude, Llama, Mistral) y compromisos empresariales como descuentos por uso comprometido.
La caché de contexto es compatible con las familias Gemini 2.5 y Gemini 1.5 en Vertex AI. Los tokens de entrada en caché se facturan a aproximadamente el 25 % de la tarifa estándar de entrada, lo que supone un ahorro de en torno al 75 % en los tokens almacenados en caché. Los modelos que no son Gemini (Claude, Llama, Mistral) no admiten caché de contexto en Vertex AI.
Batch Prediction es un endpoint de inferencia asíncrono para cargas que no dependen de la latencia. Los trabajos se procesan en segundo plano con un SLA de finalización de 24 horas. A cambio, todos los costes de tokens de entrada y salida reciben un 50 % de descuento fijo, ideal para procesamiento masivo de documentos, etiquetado de conjuntos de datos y pipelines de evaluación.
El Model Garden de Vertex AI aloja Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) y Mistral (Large, Nemo) junto a la familia Gemini de Google. Cada modelo se factura con sus propias tarifas por token, que esta calculadora incluye como predefinidos.
En los modelos Gemini de Vertex AI, las entradas multimodales se convierten en recuentos de tokens antes de facturar. Los pesos estándar son: imágenes a 258 tokens cada una, audio a 32 tokens por segundo y vídeo a 258 tokens por segundo. La calculadora incluye un estimador multimodal para calcularlo automáticamente.
Sí. La calculadora de costes de Vertex AI procesa todos los cálculos íntegramente en el lado del cliente, en tu navegador. Los recuentos de tokens, volúmenes de peticiones y estimaciones de precio nunca salen de tu dispositivo y nunca se transmiten a ningún servidor. Tus datos permanecen 100 % privados.