Calculateur de coûts Vertex AI
Calculez gratuitement en ligne les dépenses des modèles Google Vertex AI. Estimez les coûts de tokens des modèles Gemini, Claude, Llama et Mistral avec remises de cache de contexte, économies Batch Prediction, poids de tokens multimodaux et prévisions mensuelles. Totalement privé - dans votre navigateur.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Quels modèles vous pouvez facturer sur Vertex AI
Vertex AI ne sert pas seulement les modèles Google : son Model Garden inclut Gemini, Claude, Llama et Mistral, chacun avec ses propres tarifs par token.
Bien choisir la famille compte plus qu'optimiser des tokens à la marge.
- Gemini : cache de contexte et tarifs par token propres à Google.
- Claude, Llama et Mistral : tarifs tiers via la plateforme.
- Batch Prediction applique 50 % de remise sur les modèles compatibles.
Cache de contexte et Batch Prediction
Le cache de contexte est le levier principal quand vous réutilisez un grand contexte stable. Il n'est disponible que sur les modèles Gemini.
- Tokens en cache : environ 25 % du tarif d'entrée.
- Batch Prediction : ~50 % de remise, avec 24 h de latence.
- Combinez les deux si le contexte est stable et la latence non critique.
Entrées multimodales et planification
Images, audio et vidéo sont convertis en tokens avant facturation : estimez leur impact sur le coût total.
- Définissez les tokens d'entrée et de sortie par requête.
- Choisissez le modèle et activez le cache si applicable.
- Pour les médias, estimez leurs tokens avec le convertisseur multimodal.
- Vérifiez la prévision mensuelle avant de fixer le budget.
Foire aux questions
C'est un outil qui estime les dépenses d'inférence des modèles Google Cloud Vertex AI selon vos tokens d'entrée et de sortie, votre volume de requêtes et le modèle choisi. Il couvre les modèles Gemini, Claude, Llama et Mistral disponibles. Notre calculateur fonctionne entièrement dans votre navigateur, sans inscription.
Google AI Studio vise les développeurs individuels avec une facturation simplifiée, tandis que Vertex AI est la plateforme entreprise avec intégration Google Cloud complète, contrôles IAM, support VPC-SC et SLA. Pour les modèles Gemini, la tarification par token est identique sur les deux plateformes. La différence clé : Vertex AI propose aussi des modèles tiers (Claude, Llama, Mistral) et des engagements entreprise.
Le cache de contexte est pris en charge sur les familles Gemini 2.5 et Gemini 1.5 de Vertex AI. Les tokens d'entrée mis en cache sont facturés à environ 25 % du tarif standard - soit ~75 % d'économie sur les tokens cachés. Les modèles non-Gemini (Claude, Llama, Mistral) ne le prennent pas en charge sur Vertex AI.
Batch Prediction est un endpoint d'inférence asynchrone pour les charges non sensibles à la latence. Les jobs sont traités en arrière-plan avec un SLA de 24 heures. En échange, tous les coûts de tokens d'entrée et de sortie bénéficient d'une remise fixe de 50 % - idéal pour le traitement de documents en masse, l'étiquetage de jeux de données et les pipelines d'évaluation.
Le Model Garden de Vertex AI héberge Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) et Mistral (Large, Nemo) aux côtés de la famille Gemini. Chaque modèle est facturé à ses propres tarifs par token, inclus comme préréglages dans ce calculateur.
Pour les modèles Gemini sur Vertex AI, les entrées multimodales sont converties en tokens avant facturation. Poids standards : images à 258 tokens chacune, audio à 32 tokens par seconde et vidéo à 258 tokens par seconde. Le calculateur inclut un estimateur multimodal pour les calculer automatiquement.
Oui. Le calculateur traite tous les calculs entièrement côté client dans votre navigateur. Vos décomptes de tokens, volumes de requêtes et estimations de prix ne quittent jamais votre appareil et ne sont jamais transmis à un serveur. Vos données restent 100 % privées.