Pular para o conteúdo
Aback Tools Logo

Calculadora de custos do Vertex AI

Calcule grátis e online os gastos dos modelos do Google Vertex AI. Estime custos de tokens nos modelos Gemini, Claude, Llama e Mistral com descontos de cache de contexto, economia do Batch Prediction, pesos multimodais de tokens e projeções mensais. Totalmente privado — roda no seu navegador.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Quais modelos você pode cobrar no Vertex AI

O Vertex AI não serve apenas modelos Google: seu Model Garden inclui Gemini, Claude, Llama e Mistral, cada um com suas próprias tarifas por token.

Escolher a família certa importa mais do que otimizar tokens na margem.

  • Gemini: cache de contexto e preços por token próprios do Google.
  • Claude, Llama e Mistral: tarifas de terceiros na plataforma.
  • Batch Prediction aplica 50 % de desconto em modelos compatíveis.

Cache de contexto e Batch Prediction

O cache de contexto é a maior alavanca quando você reutiliza um contexto grande e estável. Está disponível apenas nos modelos Gemini.

  • Tokens em cache: cerca de 25 % da tarifa de entrada.
  • Batch Prediction: ~50 % de desconto, com 24 h de latência.
  • Combine os dois quando o contexto é estável e a latência não é crítica.

Entradas multimodais e planejamento

Imagens, áudio e vídeo são convertidos em tokens antes da cobrança: estime o impacto no custo total.

  1. Defina tokens de entrada e saída por requisição.
  2. Escolha o modelo e ative o cache quando aplicável.
  3. Se houver mídia, estime os tokens no conversor multimodal.
  4. Revise a projeção mensal antes de fechar o orçamento.

Perguntas frequentes

É uma ferramenta que estima os gastos de inferência dos modelos do Google Cloud Vertex AI com base nos seus tokens de entrada e saída, no volume de requisições e no modelo escolhido. Cobre os modelos Gemini, Claude, Llama e Mistral disponíveis. Nossa calculadora roda inteiramente no navegador, sem cadastro.

O Google AI Studio é voltado a desenvolvedores individuais com cobrança mais simples, enquanto o Vertex AI é a plataforma empresarial com integração completa ao Google Cloud, controles IAM, suporte a VPC-SC e SLA. Para modelos Gemini, o preço por token é idêntico nas duas plataformas. A diferença principal é que o Vertex AI também oferece modelos de terceiros (Claude, Llama, Mistral) e compromissos empresariais.

O cache de contexto é suportado nas famílias Gemini 2.5 e Gemini 1.5 no Vertex AI. Tokens de entrada em cache são cobrados a cerca de 25 % da tarifa padrão — economia de aproximadamente 75 % nos tokens em cache. Modelos não-Gemini (Claude, Llama, Mistral) não suportam cache de contexto no Vertex AI.

O Batch Prediction é um endpoint de inferência assíncrono para cargas que não dependem de latência. Os trabalhos são processados em segundo plano com SLA de 24 horas. Em troca, todos os custos de tokens de entrada e saída recebem 50 % de desconto fixo — ideal para processamento massivo de documentos, rotulagem de datasets e pipelines de avaliação.

O Model Garden do Vertex AI hospeda Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) e Mistral (Large, Nemo) junto à família Gemini do Google. Cada modelo é cobrado com suas próprias tarifas por token, incluídas como presets nesta calculadora.

Nos modelos Gemini no Vertex AI, entradas multimodais são convertidas em contagens de tokens antes da cobrança. Pesos padrão: imagens a 258 tokens cada, áudio a 32 tokens por segundo e vídeo a 258 tokens por segundo. A calculadora inclui um estimador multimodal para calcular isso automaticamente.

Sim. A calculadora processa todos os cálculos inteiramente no lado do cliente, no seu navegador. Contagens de tokens, volumes de requisições e estimativas de preço nunca saem do seu dispositivo e nunca são transmitidos a servidor algum. Seus dados permanecem 100 % privados.