Kalkulator Biaya Hosting LLM
Hitung biaya infrastruktur untuk self-host model bahasa besar — gratis dan 100 % privat di browser Anda. Bandingkan sewa GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS), inferensi serverless terkelola (Together AI, Groq, Fireworks AI, DeepInfra), dan hardware sendiri untuk model open-weight populer seperti Llama 3.1, Mistral, Qwen, DeepSeek, dan Gemma. Termasuk pemeriksaan kompatibilitas VRAM, penghitungan berbasis kuantisasi, estimasi biaya per permintaan, dan tabel perbandingan lengkap.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
Tiga cara hosting LLM
Self-host bukan satu hal tunggal: Anda bisa menyewa GPU per jam, membayar inferensi terkelola per token, atau membeli hardware. Tiap model biaya menang di skenario berbeda.
Pilihan terutama bergantung pada konsistensi beban: GPU sewaan berbiaya sama baik terpakai maupun menganggur.
- Sewa GPU: tarif per jam tetap, Anda mengelola stack-nya.
- Inferensi terkelola: bayar per token, tanpa biaya menganggur.
- Hardware sendiri: investasi awal, biaya per jam lebih rendah jangka panjang.
VRAM dan kuantisasi
Sebelum membandingkan harga, pastikan model muat di GPU yang dipertimbangkan. Kuantisasi adalah tuas paling langsung untuk menurunkan kebutuhan VRAM.
- FP16/BF16: 2 byte per parameter.
- INT8: setengah VRAM, kehilangan kualitas minimal.
- INT4: seperempat VRAM, dengan kualitas 1-5 % lebih rendah per benchmark.
Utilisasi dan biaya per permintaan
Harga per jam hanya separuh cerita. Utilisasi nyata menentukan berapa banyak tarif itu berubah menjadi kerja berguna.
- Estimasi token harian dan permintaan per menit pada jam sibuk.
- Hitung utilisasi yang diharapkan sesuai pola trafik Anda.
- Bagi biaya per jam dengan permintaan yang benar-benar dilayani.
- Bandingkan biaya per permintaan itu dengan API terkelola.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan pengeluaran infrastruktur untuk menjalankan model bahasa besar sendiri — pada GPU cloud sewaan, API inferensi serverless terkelola, atau hardware sendiri. Alat ini membantu developer dan tim membandingkan opsi deployment, menghitung biaya per permintaan dan bulanan, memeriksa kebutuhan VRAM, dan memutuskan apakah self-host lebih hemat daripada API terkelola. Kalkulator kami berjalan 100 % di browser tanpa pendaftaran.
Titik impasnya bergantung pada volume permintaan dan pilihan model. Pada volume rendah (di bawah 500 ribu token/hari), API terkelola biasanya lebih murah karena Anda menghindari biaya GPU menganggur. Pada volume tinggi (di atas 5 juta token/hari), sewa GPU khusus atau hardware sendiri biasanya 60-90 % lebih murah per token daripada harga API terkelola untuk model open-weight setara.
Llama 3.1 70B membutuhkan sekitar 140 GB VRAM pada presisi FP16/BF16 (2× A100 80GB), ~72 GB pada INT8 (1× H100 80GB), dan ~40 GB pada kuantisasi INT4 (1× A100 80GB). Kalkulator kami menampilkan kebutuhan VRAM secara otomatis saat Anda memilih model dan tingkat kuantisasi, serta menandai opsi deployment yang kompatibel.
Ini adalah persentase waktu GPU benar-benar memproses permintaan inferensi selama jam aktif. Utilisasi rendah (20-30 %) berarti Anda membayar komputasi menganggur, sehingga biaya efektif per permintaan naik. Utilisasi tinggi (70-90 %) mengamortisasi tarif per jam lebih baik ke lebih banyak permintaan. Server inferensi produksi dengan batching kontinu (vLLM, TGI) biasanya mencapai 50-80 % pada beban konstan.
Sewa GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS) memberi GPU khusus dengan tarif per jam tetap: Anda memasang dan mengelola stack serving sendiri. Inferensi terkelola (Together AI, Groq, Fireworks AI) menangani seluruh infrastruktur dan menagih per token yang dikonsumsi, tanpa biaya menganggur. Sewa GPU lebih baik untuk beban tinggi yang konsisten; inferensi terkelola untuk pemakaian tak terduga atau bervolume rendah.
Kuantisasi menurunkan presisi bobot dari FP16 (2 byte/parameter) ke INT8 (1 byte) atau INT4 (0,5 byte), memangkas kebutuhan VRAM 50-75 %. Ini memungkinkan menjalankan model 70B di hardware lebih murah atau menampung model lebih besar di GPU yang sama. Kuantisasi INT4 (GGUF Q4, AWQ, GPTQ) menurunkan kualitas 1-5 % di sebagian besar benchmark — masih dapat diterima untuk banyak kasus produksi.
Estimasi didasarkan pada angka benchmark publik per model di hardware H100 SXM, diskalakan menurut jumlah GPU dan utilisasi. Throughput nyata bergantung pada framework serving Anda (vLLM, TGI, Ollama), ukuran batch, panjang konteks, dan konfigurasi hardware. Anggap ini sebagai estimasi orde besaran untuk perencanaan kapasitas.
Ya. Kalkulator berjalan sepenuhnya di browser Anda memakai JavaScript sisi klien. Pilihan model, volume pemakaian, biaya infrastruktur, dan semua hasil perhitungan diproses lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu akun dan tidak ada data yang disimpan. Perencanaan infrastruktur Anda tetap sepenuhnya privat dan aman.