Kalkulator Biaya AI Self-Hosted
Bandingkan biaya nyata self-host LLM open-source dengan penyedia API terkelola — gratis dan 100 % privat di browser Anda. Konfigurasikan beban kerja, pilih opsi infrastruktur GPU (RunPod, Vast.ai, Lambda, AWS, GCP, server sendiri), tambahkan overhead DevOps, dan dapatkan perbandingan bulanan berdampingan, biaya per juta token, pemeriksaan kapasitas throughput, dan periode balik modal server sendiri.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
Biaya nyata melampaui harga GPU
Sewa per jam hanya bagian paling terlihat. Waktu engineering, jaringan, dan penyimpanan sering menambah 30 sampai 60 % ke biaya mentah.
Membandingkan hanya tarif GPU dengan harga per token API akan menghasilkan kesimpulan keliru.
- GPU: tarif per jam × jam dalam sebulan.
- DevOps: jam engineering × biaya penuh per jam.
- Tambahan: jaringan, penyimpanan, dan penyiapan framework.
Utilisasi dan kuantisasi
Biaya efektif per token bergantung pada utilisasi sekaligus harga per jam. GPU yang setengah kosong melipatgandakan biaya satuan.
- Utilisasi rendah = biaya per token proporsional lebih tinggi.
- Batching dan vLLM meningkatkan utilisasi di produksi.
- INT4/Q4 memangkas VRAM dan memungkinkan model lebih besar di GPU murah.
Kapan tiap opsi menang
Cloud menang untuk beban variabel atau proyek singkat. Hardware sendiri menang dengan pemakaian tinggi dan konstan selama bertahun-tahun.
- Estimasi token harian dan utilisasi berkelanjutan Anda.
- Hitung biaya bulanan self-host dengan GPU dan DevOps.
- Bandingkan dengan harga API terkelola untuk beban yang sama.
- Jika pemakaian stabil dan tinggi, hitung amortisasi server sendiri 3-4 tahun.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan total biaya bulanan menjalankan LLM open-source di infrastruktur GPU Anda sendiri — termasuk sewa GPU atau biaya hardware teramortisasi, tenaga kerja DevOps, dan overhead operasional — lalu membandingkannya dengan harga API terkelola untuk beban kerja yang sama.
Titik impas bergantung pada model, efisiensi GPU, dan overhead operasional. Untuk model kecil seperti Llama 3.1 8B, self-host kompetitif pada sekitar 500 ribu sampai 2 juta token/hari. Untuk model 70B, titik impasnya biasanya 5-20 juta token/hari.
Tarif per jam GPU hanya sebagian dari biaya nyata. Waktu engineering DevOps (US$ 500-3.000/bulan), jaringan, penyimpanan, dan penyiapan framework serving menambah 30-60 % di atas biaya GPU mentah. Selalu sertakan ini saat membandingkan dengan harga API.
Ini persentase komputasi GPU yang aktif memproses permintaan. Pada utilisasi 30 %, biaya efektif per token 3× lebih tinggi daripada pada 90 %. Batching permintaan dan framework seperti vLLM krusial untuk utilisasi tinggi dan daya saing ekonomi.
Kuantisasi (INT4/Q4) menurunkan kebutuhan VRAM sekitar 70 %, memungkinkan model lebih besar di GPU lebih murah. Kompensasinya: throughput turun 10-20 % dan kualitas sedikit menurun. Untuk sebagian besar beban inferensi produksi, ini trade-off yang baik saat VRAM menjadi hambatan.
Untuk deployment cloud satu model sederhana, anggarkan 5-20 jam/bulan waktu engineer. Pada tarif penuh US$ 80-150/jam, itu US$ 400-3.000/bulan. Mulai dengan 10-20 jam/bulan dan catat waktu nyata pada kuartal pertama untuk menyempurnakan proyeksi.
Ya. Kalkulator berjalan sepenuhnya di browser Anda. Volume beban kerja, pilihan infrastruktur, dan semua hasil diproses lokal di perangkat Anda dan tidak pernah dikirim ke server, disimpan, atau dibagikan. Tidak perlu login.
Untuk model kecil murah: Vast.ai (~US$ 0,35/jam RTX 4090) dan RunPod (~US$ 0,44/jam L4). Untuk inferensi produksi 7-13B: RunPod atau Lambda (A10G/A100 pada US$ 0,76-1,64/jam). Untuk model 70B+: RunPod H100 (US$ 3,49/jam). Untuk beban stabil yang hemat: hardware sendiri dengan amortisasi 3-4 tahun.