Calculadora de custos do Vertex AI
Calcule grátis e online os gastos dos modelos do Google Vertex AI. Estime custos de tokens nos modelos Gemini, Claude, Llama e Mistral com descontos de cache de contexto, economia do Batch Prediction, pesos multimodais de tokens e projeções mensais. Totalmente privado — roda no seu navegador.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Quais modelos você pode cobrar no Vertex AI
O Vertex AI não serve apenas modelos Google: seu Model Garden inclui Gemini, Claude, Llama e Mistral, cada um com suas próprias tarifas por token.
Escolher a família certa importa mais do que otimizar tokens na margem.
- Gemini: cache de contexto e preços por token próprios do Google.
- Claude, Llama e Mistral: tarifas de terceiros na plataforma.
- Batch Prediction aplica 50 % de desconto em modelos compatíveis.
Cache de contexto e Batch Prediction
O cache de contexto é a maior alavanca quando você reutiliza um contexto grande e estável. Está disponível apenas nos modelos Gemini.
- Tokens em cache: cerca de 25 % da tarifa de entrada.
- Batch Prediction: ~50 % de desconto, com 24 h de latência.
- Combine os dois quando o contexto é estável e a latência não é crítica.
Entradas multimodais e planejamento
Imagens, áudio e vídeo são convertidos em tokens antes da cobrança: estime o impacto no custo total.
- Defina tokens de entrada e saída por requisição.
- Escolha o modelo e ative o cache quando aplicável.
- Se houver mídia, estime os tokens no conversor multimodal.
- Revise a projeção mensal antes de fechar o orçamento.
Perguntas frequentes
É uma ferramenta que estima os gastos de inferência dos modelos do Google Cloud Vertex AI com base nos seus tokens de entrada e saída, no volume de requisições e no modelo escolhido. Cobre os modelos Gemini, Claude, Llama e Mistral disponíveis. Nossa calculadora roda inteiramente no navegador, sem cadastro.
O Google AI Studio é voltado a desenvolvedores individuais com cobrança mais simples, enquanto o Vertex AI é a plataforma empresarial com integração completa ao Google Cloud, controles IAM, suporte a VPC-SC e SLA. Para modelos Gemini, o preço por token é idêntico nas duas plataformas. A diferença principal é que o Vertex AI também oferece modelos de terceiros (Claude, Llama, Mistral) e compromissos empresariais.
O cache de contexto é suportado nas famílias Gemini 2.5 e Gemini 1.5 no Vertex AI. Tokens de entrada em cache são cobrados a cerca de 25 % da tarifa padrão — economia de aproximadamente 75 % nos tokens em cache. Modelos não-Gemini (Claude, Llama, Mistral) não suportam cache de contexto no Vertex AI.
O Batch Prediction é um endpoint de inferência assíncrono para cargas que não dependem de latência. Os trabalhos são processados em segundo plano com SLA de 24 horas. Em troca, todos os custos de tokens de entrada e saída recebem 50 % de desconto fixo — ideal para processamento massivo de documentos, rotulagem de datasets e pipelines de avaliação.
O Model Garden do Vertex AI hospeda Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) e Mistral (Large, Nemo) junto à família Gemini do Google. Cada modelo é cobrado com suas próprias tarifas por token, incluídas como presets nesta calculadora.
Nos modelos Gemini no Vertex AI, entradas multimodais são convertidas em contagens de tokens antes da cobrança. Pesos padrão: imagens a 258 tokens cada, áudio a 32 tokens por segundo e vídeo a 258 tokens por segundo. A calculadora inclui um estimador multimodal para calcular isso automaticamente.
Sim. A calculadora processa todos os cálculos inteiramente no lado do cliente, no seu navegador. Contagens de tokens, volumes de requisições e estimativas de preço nunca saem do seu dispositivo e nunca são transmitidos a servidor algum. Seus dados permanecem 100 % privados.