Kalkulator Biaya Vertex AI
Hitung gratis dan online pengeluaran model Google Vertex AI. Estimasi biaya token di model Gemini, Claude, Llama, dan Mistral dengan diskon cache konteks, penghematan Batch Prediction, bobot token multimodal, dan proyeksi bulanan. Sepenuhnya privat — berjalan di browser Anda.
Estimate Google Vertex AI model expenses across Gemini, Claude, Llama, and Mistral families. Configure context caching, Batch API discounts, multimodal media token weights, and forecast monthly and annual API spending - all locally in your browser.
Prompt Tokens
Cost Optimizations
Workload Volume
Projected Monthly Workload Cost
Cost per Single Call
$0.0163
Input Token Cost
$0.006250
Output Token Cost
$0.0100
Model Pricing Comparison
Sorted by lowest cost| Model | Cost/Call | Monthly Forecast | Features |
|---|---|---|---|
Gemini 1.5 FlashCost-Effective Gemini 1.5 (Vertex) • 1,000K ctx | $0.000675 | $20.25 | Caching |
Mistral NemoCost-Effective Mistral on Vertex • 128K ctx | $0.001800 | $54.00 | No Cache |
Gemini 2.5 FlashCost-Effective Gemini 2.5 (Vertex) • 1,000K ctx | $0.004000 | $120.00 | Caching |
Llama 3.3 70B InstructCost-Effective Llama on Vertex • 128K ctx | $0.004320 | $129.60 | No Cache |
Claude 3.5 HaikuCost-Effective Claude on Vertex • 200K ctx | $0.008000 | $240.00 | No Cache |
Gemini 1.5 Pro Gemini 1.5 (Vertex) • 2,000K ctx | $0.0112 | $337.50 | Caching |
Gemini 2.5 ProCapable Selected Gemini 2.5 (Vertex) • 2,000K ctx | $0.0163 | $487.50 | Caching |
Claude 3.7 SonnetCapable Claude on Vertex • 200K ctx | $0.0300 | $900.00 | No Cache |
Mistral Large Mistral on Vertex • 128K ctx | $0.0320 | $960.00 | No Cache |
Llama 3.1 405B InstructCapable Llama on Vertex • 128K ctx | $0.0410 | $1,230.00 | No Cache |
Claude 3 OpusCapable Claude on Vertex • 200K ctx | $0.1500 | $4,500.00 | No Cache |
Model apa saja yang bisa Anda hitung di Vertex AI
Vertex AI tidak hanya melayani model Google: Model Garden-nya mencakup Gemini, Claude, Llama, dan Mistral, masing-masing dengan tarif per token sendiri.
Memilih keluarga yang tepat lebih penting daripada mengoptimalkan token secara marginal.
- Gemini: cache konteks dan harga per token milik Google.
- Claude, Llama, dan Mistral: tarif pihak ketiga lewat platform.
- Batch Prediction memberi diskon 50 % pada model yang didukung.
Cache konteks dan Batch Prediction
Cache konteks adalah tuas terbesar saat Anda memakai ulang konteks besar yang stabil. Ini hanya tersedia pada model Gemini.
- Token cache: sekitar 25 % dari tarif input.
- Batch Prediction: ~50 % diskon, dengan latensi 24 jam.
- Kombinasikan keduanya bila konteks stabil dan latensi tidak kritis.
Input multimodal dan perencanaan
Gambar, audio, dan video dikonversi ke token sebelum ditagih: estimasi dampaknya pada total biaya.
- Tentukan token input dan output per permintaan.
- Pilih model dan aktifkan cache bila berlaku.
- Bila ada media, estimasi tokennya di konverter multimodal.
- Tinjau proyeksi bulanan sebelum menetapkan anggaran.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan pengeluaran inferensi model Google Cloud Vertex AI berdasarkan jumlah token input dan output, volume permintaan, dan model yang dipilih. Alat ini mencakup model Gemini, Claude, Llama, dan Mistral yang tersedia. Kalkulator kami berjalan sepenuhnya di browser, tanpa pendaftaran.
Google AI Studio menargetkan developer individu dengan penagihan lebih sederhana, sedangkan Vertex AI adalah platform enterprise dengan integrasi Google Cloud penuh, kontrol IAM, dukungan VPC-SC, dan SLA. Untuk model Gemini, harga per token identik di kedua platform. Perbedaan utamanya, Vertex AI juga menawarkan model pihak ketiga (Claude, Llama, Mistral) dan komitmen enterprise.
Cache konteks didukung pada keluarga Gemini 2.5 dan Gemini 1.5 di Vertex AI. Token input yang di-cache ditagih sekitar 25 % dari tarif standar — artinya menghemat sekitar 75 % pada token yang di-cache. Model non-Gemini (Claude, Llama, Mistral) tidak mendukung cache konteks di Vertex AI.
Batch Prediction adalah endpoint inferensi asinkron untuk beban yang tidak sensitif latensi. Pekerjaan diproses di latar belakang dengan SLA 24 jam. Sebagai gantinya, semua biaya token input dan output mendapat diskon tetap 50 % — ideal untuk pemrosesan dokumen massal, pelabelan dataset, dan pipeline evaluasi.
Model Garden Vertex AI menghadirkan Anthropic Claude (3.7 Sonnet, 3.5 Haiku, 3 Opus), Meta Llama (3.1 405B, 3.3 70B), dan Mistral (Large, Nemo) bersama keluarga Gemini. Setiap model ditagih dengan tarif per token masing-masing, yang disertakan sebagai preset di kalkulator ini.
Pada model Gemini di Vertex AI, input multimodal dikonversi ke jumlah token sebelum ditagih. Bobot standar: gambar 258 token masing-masing, audio 32 token per detik, dan video 258 token per detik. Kalkulator menyertakan estimator multimodal untuk menghitungnya otomatis.
Ya. Kalkulator memproses semua perhitungan sepenuhnya di sisi klien di browser Anda. Jumlah token, volume permintaan, dan estimasi harga tidak pernah meninggalkan perangkat Anda dan tidak pernah dikirim ke server mana pun. Data Anda tetap 100 % privat.