Saltar al contenido
Aback Tools Logo

Calculadora de costes de Vertex AI

Calcula gratis y online los gastos de los modelos de Google Vertex AI. Estima costes de tokens en los modelos Gemini, Claude, Llama y Mistral con descuentos de caché de contexto, ahorro de Batch Prediction, pesos multimodales de tokens y previsiones mensuales. Totalmente privado: funciona en tu navegador.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Qué modelos puedes facturar en Vertex AI

Vertex AI no sirve solo modelos de Google: su Model Garden incluye Gemini, Claude, Llama y Mistral, cada uno con sus propias tarifas por token.

Elegir la familia correcta importa más que optimizar tokens en el margen.

  • Gemini: caché de contexto y precios por token propios de Google.
  • Claude, Llama y Mistral: tarifas de terceros dentro de la plataforma.
  • Batch Prediction aplica un 50 % de descuento a todos los modelos compatibles.

Caché de contexto y Batch Prediction

La caché de contexto es la mayor palanca cuando reutilizas un contexto grande y estable. Solo está disponible en los modelos Gemini.

  • Tokens en caché: en torno al 25 % de la tarifa de entrada.
  • Batch Prediction: cerca del 50 % de descuento, con 24 h de latencia.
  • Combina ambas cuando el contexto es estable y la latencia no crítica.

Entradas multimodales y planificación

Las imágenes, el audio y el vídeo se convierten en tokens antes de facturar, así que conviene estimar su impacto en el coste total.

  1. Define los tokens de entrada y salida por petición.
  2. Elige el modelo y activa la caché si aplica.
  3. Si hay medios, estima sus tokens con el conversor multimodal.
  4. Revisa la previsión mensual antes de fijar el presupuesto.

Preguntas frecuentes

Es una herramienta que estima los gastos de inferencia de modelos de Google Cloud Vertex AI según tus tokens de entrada y salida, el volumen de peticiones y el modelo elegido. Cubre los modelos Gemini, Claude, Llama y Mistral disponibles en la plataforma. Nuestra calculadora funciona íntegramente en tu navegador y no requiere registro.

Google AI Studio se orienta a desarrolladores individuales con una facturación más sencilla, mientras que Vertex AI es la plataforma empresarial con integración completa de Google Cloud, controles IAM, soporte VPC-SC y SLA. Para los modelos Gemini, el precio por token es idéntico en ambas plataformas. La diferencia clave es que Vertex AI también ofrece modelos de terceros (Claude, Llama, Mistral) y compromisos empresariales como descuentos por uso comprometido.

La caché de contexto es compatible con las familias Gemini 2.5 y Gemini 1.5 en Vertex AI. Los tokens de entrada en caché se facturan a aproximadamente el 25 % de la tarifa estándar de entrada, lo que supone un ahorro de en torno al 75 % en los tokens almacenados en caché. Los modelos que no son Gemini (Claude, Llama, Mistral) no admiten caché de contexto en Vertex AI.

Batch Prediction es un endpoint de inferencia asíncrono para cargas que no dependen de la latencia. Los trabajos se procesan en segundo plano con un SLA de finalización de 24 horas. A cambio, todos los costes de tokens de entrada y salida reciben un 50 % de descuento fijo, ideal para procesamiento masivo de documentos, etiquetado de conjuntos de datos y pipelines de evaluación.

El Model Garden de Vertex AI aloja Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) y Mistral (Large, Nemo) junto a la familia Gemini de Google. Cada modelo se factura con sus propias tarifas por token, que esta calculadora incluye como predefinidos.

En los modelos Gemini de Vertex AI, las entradas multimodales se convierten en recuentos de tokens antes de facturar. Los pesos estándar son: imágenes a 258 tokens cada una, audio a 32 tokens por segundo y vídeo a 258 tokens por segundo. La calculadora incluye un estimador multimodal para calcularlo automáticamente.

Sí. La calculadora de costes de Vertex AI procesa todos los cálculos íntegramente en el lado del cliente, en tu navegador. Los recuentos de tokens, volúmenes de peticiones y estimaciones de precio nunca salen de tu dispositivo y nunca se transmiten a ningún servidor. Tus datos permanecen 100 % privados.