Vertex-AI-Kostenrechner
Berechnen Sie die Modellausgaben von Google Vertex AI kostenlos online. Schätzen Sie Token-Kosten über Gemini-, Claude-, Llama- und Mistral-Modelle mit Context-Caching-Rabatten, Batch-Prediction-Einsparungen, multimodalen Token-Gewichten und Monatsprognosen. Vollständig privat – im Browser.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Welche Modelle Sie auf Vertex AI abrechnen können
Vertex AI bedient nicht nur Google-Modelle: Der Model Garden umfasst Gemini, Claude, Llama und Mistral, jeweils mit eigenen Token-Preisen.
Die richtige Familie zu wählen, zählt mehr als Token am Rand zu optimieren.
- Gemini: Context-Caching und googleeigene Token-Preise.
- Claude, Llama und Mistral: Fremdtarife über die Plattform.
- Batch Prediction gewährt 50 % Rabatt auf unterstützte Modelle.
Context-Caching und Batch Prediction
Context-Caching ist der größte Hebel, wenn Sie einen großen, stabilen Kontext wiederverwenden. Es gibt es nur bei Gemini-Modellen.
- Gecachte Tokens: rund 25 % des Eingabetarifs.
- Batch Prediction: ~50 % Rabatt, mit 24 h Latenz.
- Beides kombinieren, wenn der Kontext stabil und Latenz unkritisch ist.
Multimodale Eingaben und Planung
Bilder, Audio und Video werden vor der Abrechnung in Tokens umgerechnet: Schätzen Sie ihren Anteil an den Gesamtkosten.
- Legen Sie Ein- und Ausgabe-Tokens pro Anfrage fest.
- Wählen Sie das Modell und aktivieren Sie ggf. Caching.
- Bei Medien die Tokens mit dem multimodalen Konverter schätzen.
- Prüfen Sie die Monatsprognose vor der Budgetfestlegung.
Häufig gestellte Fragen
Er schätzt die Inferenzausgaben von Google Cloud Vertex AI anhand Ihrer Ein- und Ausgabe-Tokens, des Anfragevolumens und des gewählten Modells. Er deckt die verfügbaren Gemini-, Claude-, Llama- und Mistral-Modelle ab. Unser Rechner läuft vollständig im Browser, ohne Registrierung.
Google AI Studio richtet sich mit einfacherer Abrechnung an Einzelentwickler, Vertex AI ist die Enterprise-Plattform mit voller Google-Cloud-Integration, IAM-Kontrollen, VPC-SC-Unterstützung und SLAs. Für Gemini-Modelle ist die Token-Preisgestaltung auf beiden Plattformen identisch. Der Hauptunterschied: Vertex AI bietet zusätzlich Fremdmodelle (Claude, Llama, Mistral) und Enterprise-Commitments.
Context-Caching wird bei den Gemini-2.5- und Gemini-1.5-Familien auf Vertex AI unterstützt. Gecachte Eingabe-Tokens werden mit etwa 25 % des Standardtarifs berechnet – rund 75 % Ersparnis bei zwischengespeicherten Tokens. Nicht-Gemini-Modelle (Claude, Llama, Mistral) unterstützen kein Context-Caching auf Vertex AI.
Batch Prediction ist ein asynchroner Inferenz-Endpunkt für nicht latenzkritische Workloads. Jobs werden im Hintergrund mit 24-Stunden-SLA verarbeitet. Dafür erhalten alle Ein- und Ausgabe-Token-Kosten pauschal 50 % Rabatt – ideal für Massendokumentverarbeitung, Datensatz-Labeling und Evaluationspipelines.
Der Model Garden von Vertex AI hostet Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) und Mistral (Large, Nemo) neben Googles Gemini-Familie. Jedes Modell wird zu eigenen Token-Preisen abgerechnet, die dieser Rechner als Presets enthält.
Bei Gemini-Modellen auf Vertex AI werden multimodale Eingaben vor der Abrechnung in Token umgerechnet. Standardgewichte: Bilder mit 258 Tokens, Audio mit 32 Tokens pro Sekunde und Video mit 258 Tokens pro Sekunde. Der Rechner enthält einen multimodalen Schätzer.
Ja. Der Rechner verarbeitet alle Berechnungen vollständig clientseitig im Browser. Token-Zahlen, Anfragevolumen und Preisschätzungen verlassen Ihr Gerät nie und werden nie an einen Server übertragen. Ihre Daten bleiben 100 % privat.