Aller au contenu
Aback Tools Logo

Calculateur de coûts Vertex AI

Calculez gratuitement en ligne les dépenses des modèles Google Vertex AI. Estimez les coûts de tokens des modèles Gemini, Claude, Llama et Mistral avec remises de cache de contexte, économies Batch Prediction, poids de tokens multimodaux et prévisions mensuelles. Totalement privé - dans votre navigateur.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Quels modèles vous pouvez facturer sur Vertex AI

Vertex AI ne sert pas seulement les modèles Google : son Model Garden inclut Gemini, Claude, Llama et Mistral, chacun avec ses propres tarifs par token.

Bien choisir la famille compte plus qu'optimiser des tokens à la marge.

  • Gemini : cache de contexte et tarifs par token propres à Google.
  • Claude, Llama et Mistral : tarifs tiers via la plateforme.
  • Batch Prediction applique 50 % de remise sur les modèles compatibles.

Cache de contexte et Batch Prediction

Le cache de contexte est le levier principal quand vous réutilisez un grand contexte stable. Il n'est disponible que sur les modèles Gemini.

  • Tokens en cache : environ 25 % du tarif d'entrée.
  • Batch Prediction : ~50 % de remise, avec 24 h de latence.
  • Combinez les deux si le contexte est stable et la latence non critique.

Entrées multimodales et planification

Images, audio et vidéo sont convertis en tokens avant facturation : estimez leur impact sur le coût total.

  1. Définissez les tokens d'entrée et de sortie par requête.
  2. Choisissez le modèle et activez le cache si applicable.
  3. Pour les médias, estimez leurs tokens avec le convertisseur multimodal.
  4. Vérifiez la prévision mensuelle avant de fixer le budget.

Foire aux questions

C'est un outil qui estime les dépenses d'inférence des modèles Google Cloud Vertex AI selon vos tokens d'entrée et de sortie, votre volume de requêtes et le modèle choisi. Il couvre les modèles Gemini, Claude, Llama et Mistral disponibles. Notre calculateur fonctionne entièrement dans votre navigateur, sans inscription.

Google AI Studio vise les développeurs individuels avec une facturation simplifiée, tandis que Vertex AI est la plateforme entreprise avec intégration Google Cloud complète, contrôles IAM, support VPC-SC et SLA. Pour les modèles Gemini, la tarification par token est identique sur les deux plateformes. La différence clé : Vertex AI propose aussi des modèles tiers (Claude, Llama, Mistral) et des engagements entreprise.

Le cache de contexte est pris en charge sur les familles Gemini 2.5 et Gemini 1.5 de Vertex AI. Les tokens d'entrée mis en cache sont facturés à environ 25 % du tarif standard - soit ~75 % d'économie sur les tokens cachés. Les modèles non-Gemini (Claude, Llama, Mistral) ne le prennent pas en charge sur Vertex AI.

Batch Prediction est un endpoint d'inférence asynchrone pour les charges non sensibles à la latence. Les jobs sont traités en arrière-plan avec un SLA de 24 heures. En échange, tous les coûts de tokens d'entrée et de sortie bénéficient d'une remise fixe de 50 % - idéal pour le traitement de documents en masse, l'étiquetage de jeux de données et les pipelines d'évaluation.

Le Model Garden de Vertex AI héberge Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) et Mistral (Large, Nemo) aux côtés de la famille Gemini. Chaque modèle est facturé à ses propres tarifs par token, inclus comme préréglages dans ce calculateur.

Pour les modèles Gemini sur Vertex AI, les entrées multimodales sont converties en tokens avant facturation. Poids standards : images à 258 tokens chacune, audio à 32 tokens par seconde et vidéo à 258 tokens par seconde. Le calculateur inclut un estimateur multimodal pour les calculer automatiquement.

Oui. Le calculateur traite tous les calculs entièrement côté client dans votre navigateur. Vos décomptes de tokens, volumes de requêtes et estimations de prix ne quittent jamais votre appareil et ne sont jamais transmis à un serveur. Vos données restent 100 % privées.