Lompat ke konten
Aback Tools Logo

Kalkulator Biaya Vertex AI

Hitung gratis dan online pengeluaran model Google Vertex AI. Estimasi biaya token di model Gemini, Claude, Llama, dan Mistral dengan diskon cache konteks, penghematan Batch Prediction, bobot token multimodal, dan proyeksi bulanan. Sepenuhnya privat — berjalan di browser Anda.

Vertex AI Cost Calculator

Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.

Input/1M: $1.2500Output/1M: $10.0000Cache/1M: $0.3125

Prompt Tokens

tokens
tokens

Cost Optimizations

Workload Volume

reqs

Projected Monthly Workload Cost

$487.50for 30,000 total requests

Cost per Single Call

$0.0163

Input Token Cost

$0.006250

Output Token Cost

$0.0100

Model Pricing Comparison

Sorted by lowest cost
ModelCost/CallMonthly ForecastFeatures
Gemini 1.5 FlashCost-Effective
Gemini 1.5 (Vertex) • 1,000K ctx
$0.000675$20.25Caching
Mistral NemoCost-Effective
Mistral on Vertex • 128K ctx
$0.001800$54.00No Cache
Gemini 2.5 FlashCost-Effective
Gemini 2.5 (Vertex) • 1,000K ctx
$0.004000$120.00Caching
Llama 3.3 70B InstructCost-Effective
Llama on Vertex • 128K ctx
$0.004320$129.60No Cache
Claude 3.5 HaikuCost-Effective
Claude on Vertex • 200K ctx
$0.008000$240.00No Cache
Gemini 1.5 Pro
Gemini 1.5 (Vertex) • 2,000K ctx
$0.0112$337.50Caching
Gemini 2.5 ProCapable Selected
Gemini 2.5 (Vertex) • 2,000K ctx
$0.0163$487.50Caching
Claude 3.7 SonnetCapable
Claude on Vertex • 200K ctx
$0.0300$900.00No Cache
Mistral Large
Mistral on Vertex • 128K ctx
$0.0320$960.00No Cache
Llama 3.1 405B InstructCapable
Llama on Vertex • 128K ctx
$0.0410$1,230.00No Cache
Claude 3 OpusCapable
Claude on Vertex • 200K ctx
$0.1500$4,500.00No Cache
Calculations Disclaimer: Estimates use standard Vertex AI Pay-As-You-Go rates. Actual billing may vary due to regional pricing, committed use discounts, promotional credits, or Google infrastructure fees. Vertex AI context caching applies a ~75% discount on supported Gemini models for cached tokens. Batch Prediction pricing provides a 50% reduction for asynchronous workloads. Always verify rates on the official Google Cloud Vertex AI pricing page before production deployments.

Model apa saja yang bisa Anda hitung di Vertex AI

Vertex AI tidak hanya melayani model Google: Model Garden-nya mencakup Gemini, Claude, Llama, dan Mistral, masing-masing dengan tarif per token sendiri.

Memilih keluarga yang tepat lebih penting daripada mengoptimalkan token secara marginal.

  • Gemini: cache konteks dan harga per token milik Google.
  • Claude, Llama, dan Mistral: tarif pihak ketiga lewat platform.
  • Batch Prediction memberi diskon 50 % pada model yang didukung.

Cache konteks dan Batch Prediction

Cache konteks adalah tuas terbesar saat Anda memakai ulang konteks besar yang stabil. Ini hanya tersedia pada model Gemini.

  • Token cache: sekitar 25 % dari tarif input.
  • Batch Prediction: ~50 % diskon, dengan latensi 24 jam.
  • Kombinasikan keduanya bila konteks stabil dan latensi tidak kritis.

Input multimodal dan perencanaan

Gambar, audio, dan video dikonversi ke token sebelum ditagih: estimasi dampaknya pada total biaya.

  1. Tentukan token input dan output per permintaan.
  2. Pilih model dan aktifkan cache bila berlaku.
  3. Bila ada media, estimasi tokennya di konverter multimodal.
  4. Tinjau proyeksi bulanan sebelum menetapkan anggaran.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan pengeluaran inferensi model Google Cloud Vertex AI berdasarkan jumlah token input dan output, volume permintaan, dan model yang dipilih. Alat ini mencakup model Gemini, Claude, Llama, dan Mistral yang tersedia. Kalkulator kami berjalan sepenuhnya di browser, tanpa pendaftaran.

Google AI Studio menargetkan developer individu dengan penagihan lebih sederhana, sedangkan Vertex AI adalah platform enterprise dengan integrasi Google Cloud penuh, kontrol IAM, dukungan VPC-SC, dan SLA. Untuk model Gemini, harga per token identik di kedua platform. Perbedaan utamanya, Vertex AI juga menawarkan model pihak ketiga (Claude, Llama, Mistral) dan komitmen enterprise.

Cache konteks didukung pada keluarga Gemini 2.5 dan Gemini 1.5 di Vertex AI. Token input yang di-cache ditagih sekitar 25 % dari tarif standar — artinya menghemat sekitar 75 % pada token yang di-cache. Model non-Gemini (Claude, Llama, Mistral) tidak mendukung cache konteks di Vertex AI.

Batch Prediction adalah endpoint inferensi asinkron untuk beban yang tidak sensitif latensi. Pekerjaan diproses di latar belakang dengan SLA 24 jam. Sebagai gantinya, semua biaya token input dan output mendapat diskon tetap 50 % — ideal untuk pemrosesan dokumen massal, pelabelan dataset, dan pipeline evaluasi.

Model Garden Vertex AI menghadirkan Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B), dan Mistral (Large, Nemo) bersama keluarga Gemini. Setiap model ditagih dengan tarif per token masing-masing, yang disertakan sebagai preset di kalkulator ini.

Pada model Gemini di Vertex AI, input multimodal dikonversi ke jumlah token sebelum ditagih. Bobot standar: gambar 258 token masing-masing, audio 32 token per detik, dan video 258 token per detik. Kalkulator menyertakan estimator multimodal untuk menghitungnya otomatis.

Ya. Kalkulator memproses semua perhitungan sepenuhnya di sisi klien di browser Anda. Jumlah token, volume permintaan, dan estimasi harga tidak pernah meninggalkan perangkat Anda dan tidak pernah dikirim ke server mana pun. Data Anda tetap 100 % privat.