Zum Inhalt springen
Aback Tools Logo

Vertex-AI-Kostenrechner

Berechnen Sie die Modellausgaben von Google Vertex AI kostenlos online. Schätzen Sie Token-Kosten über Gemini-, Claude-, Llama- und Mistral-Modelle mit Context-Caching-Rabatten, Batch-Prediction-Einsparungen, multimodalen Token-Gewichten und Monatsprognosen. Vollständig privat – im Browser.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Welche Modelle Sie auf Vertex AI abrechnen können

Vertex AI bedient nicht nur Google-Modelle: Der Model Garden umfasst Gemini, Claude, Llama und Mistral, jeweils mit eigenen Token-Preisen.

Die richtige Familie zu wählen, zählt mehr als Token am Rand zu optimieren.

  • Gemini: Context-Caching und googleeigene Token-Preise.
  • Claude, Llama und Mistral: Fremdtarife über die Plattform.
  • Batch Prediction gewährt 50 % Rabatt auf unterstützte Modelle.

Context-Caching und Batch Prediction

Context-Caching ist der größte Hebel, wenn Sie einen großen, stabilen Kontext wiederverwenden. Es gibt es nur bei Gemini-Modellen.

  • Gecachte Tokens: rund 25 % des Eingabetarifs.
  • Batch Prediction: ~50 % Rabatt, mit 24 h Latenz.
  • Beides kombinieren, wenn der Kontext stabil und Latenz unkritisch ist.

Multimodale Eingaben und Planung

Bilder, Audio und Video werden vor der Abrechnung in Tokens umgerechnet: Schätzen Sie ihren Anteil an den Gesamtkosten.

  1. Legen Sie Ein- und Ausgabe-Tokens pro Anfrage fest.
  2. Wählen Sie das Modell und aktivieren Sie ggf. Caching.
  3. Bei Medien die Tokens mit dem multimodalen Konverter schätzen.
  4. Prüfen Sie die Monatsprognose vor der Budgetfestlegung.

Häufig gestellte Fragen

Er schätzt die Inferenzausgaben von Google Cloud Vertex AI anhand Ihrer Ein- und Ausgabe-Tokens, des Anfragevolumens und des gewählten Modells. Er deckt die verfügbaren Gemini-, Claude-, Llama- und Mistral-Modelle ab. Unser Rechner läuft vollständig im Browser, ohne Registrierung.

Google AI Studio richtet sich mit einfacherer Abrechnung an Einzelentwickler, Vertex AI ist die Enterprise-Plattform mit voller Google-Cloud-Integration, IAM-Kontrollen, VPC-SC-Unterstützung und SLAs. Für Gemini-Modelle ist die Token-Preisgestaltung auf beiden Plattformen identisch. Der Hauptunterschied: Vertex AI bietet zusätzlich Fremdmodelle (Claude, Llama, Mistral) und Enterprise-Commitments.

Context-Caching wird bei den Gemini-2.5- und Gemini-1.5-Familien auf Vertex AI unterstützt. Gecachte Eingabe-Tokens werden mit etwa 25 % des Standardtarifs berechnet – rund 75 % Ersparnis bei zwischengespeicherten Tokens. Nicht-Gemini-Modelle (Claude, Llama, Mistral) unterstützen kein Context-Caching auf Vertex AI.

Batch Prediction ist ein asynchroner Inferenz-Endpunkt für nicht latenzkritische Workloads. Jobs werden im Hintergrund mit 24-Stunden-SLA verarbeitet. Dafür erhalten alle Ein- und Ausgabe-Token-Kosten pauschal 50 % Rabatt – ideal für Massendokumentverarbeitung, Datensatz-Labeling und Evaluationspipelines.

Der Model Garden von Vertex AI hostet Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B) und Mistral (Large, Nemo) neben Googles Gemini-Familie. Jedes Modell wird zu eigenen Token-Preisen abgerechnet, die dieser Rechner als Presets enthält.

Bei Gemini-Modellen auf Vertex AI werden multimodale Eingaben vor der Abrechnung in Token umgerechnet. Standardgewichte: Bilder mit 258 Tokens, Audio mit 32 Tokens pro Sekunde und Video mit 258 Tokens pro Sekunde. Der Rechner enthält einen multimodalen Schätzer.

Ja. Der Rechner verarbeitet alle Berechnungen vollständig clientseitig im Browser. Token-Zahlen, Anfragevolumen und Preisschätzungen verlassen Ihr Gerät nie und werden nie an einen Server übertragen. Ihre Daten bleiben 100 % privat.