Lompat ke konten
Aback Tools Logo

Kalkulator Biaya Hosting LLM

Hitung biaya infrastruktur untuk self-host model bahasa besar — gratis dan 100 % privat di browser Anda. Bandingkan sewa GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS), inferensi serverless terkelola (Together AI, Groq, Fireworks AI, DeepInfra), dan hardware sendiri untuk model open-weight populer seperti Llama 3.1, Mistral, Qwen, DeepSeek, dan Gemma. Termasuk pemeriksaan kompatibilitas VRAM, penghitungan berbasis kuantisasi, estimasi biaya per permintaan, dan tabel perbandingan lengkap.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

Tiga cara hosting LLM

Self-host bukan satu hal tunggal: Anda bisa menyewa GPU per jam, membayar inferensi terkelola per token, atau membeli hardware. Tiap model biaya menang di skenario berbeda.

Pilihan terutama bergantung pada konsistensi beban: GPU sewaan berbiaya sama baik terpakai maupun menganggur.

  • Sewa GPU: tarif per jam tetap, Anda mengelola stack-nya.
  • Inferensi terkelola: bayar per token, tanpa biaya menganggur.
  • Hardware sendiri: investasi awal, biaya per jam lebih rendah jangka panjang.

VRAM dan kuantisasi

Sebelum membandingkan harga, pastikan model muat di GPU yang dipertimbangkan. Kuantisasi adalah tuas paling langsung untuk menurunkan kebutuhan VRAM.

  • FP16/BF16: 2 byte per parameter.
  • INT8: setengah VRAM, kehilangan kualitas minimal.
  • INT4: seperempat VRAM, dengan kualitas 1-5 % lebih rendah per benchmark.

Utilisasi dan biaya per permintaan

Harga per jam hanya separuh cerita. Utilisasi nyata menentukan berapa banyak tarif itu berubah menjadi kerja berguna.

  1. Estimasi token harian dan permintaan per menit pada jam sibuk.
  2. Hitung utilisasi yang diharapkan sesuai pola trafik Anda.
  3. Bagi biaya per jam dengan permintaan yang benar-benar dilayani.
  4. Bandingkan biaya per permintaan itu dengan API terkelola.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan pengeluaran infrastruktur untuk menjalankan model bahasa besar sendiri — pada GPU cloud sewaan, API inferensi serverless terkelola, atau hardware sendiri. Alat ini membantu developer dan tim membandingkan opsi deployment, menghitung biaya per permintaan dan bulanan, memeriksa kebutuhan VRAM, dan memutuskan apakah self-host lebih hemat daripada API terkelola. Kalkulator kami berjalan 100 % di browser tanpa pendaftaran.

Titik impasnya bergantung pada volume permintaan dan pilihan model. Pada volume rendah (di bawah 500 ribu token/hari), API terkelola biasanya lebih murah karena Anda menghindari biaya GPU menganggur. Pada volume tinggi (di atas 5 juta token/hari), sewa GPU khusus atau hardware sendiri biasanya 60-90 % lebih murah per token daripada harga API terkelola untuk model open-weight setara.

Llama 3.1 70B membutuhkan sekitar 140 GB VRAM pada presisi FP16/BF16 (2× A100 80GB), ~72 GB pada INT8 (1× H100 80GB), dan ~40 GB pada kuantisasi INT4 (1× A100 80GB). Kalkulator kami menampilkan kebutuhan VRAM secara otomatis saat Anda memilih model dan tingkat kuantisasi, serta menandai opsi deployment yang kompatibel.

Ini adalah persentase waktu GPU benar-benar memproses permintaan inferensi selama jam aktif. Utilisasi rendah (20-30 %) berarti Anda membayar komputasi menganggur, sehingga biaya efektif per permintaan naik. Utilisasi tinggi (70-90 %) mengamortisasi tarif per jam lebih baik ke lebih banyak permintaan. Server inferensi produksi dengan batching kontinu (vLLM, TGI) biasanya mencapai 50-80 % pada beban konstan.

Sewa GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS) memberi GPU khusus dengan tarif per jam tetap: Anda memasang dan mengelola stack serving sendiri. Inferensi terkelola (Together AI, Groq, Fireworks AI) menangani seluruh infrastruktur dan menagih per token yang dikonsumsi, tanpa biaya menganggur. Sewa GPU lebih baik untuk beban tinggi yang konsisten; inferensi terkelola untuk pemakaian tak terduga atau bervolume rendah.

Kuantisasi menurunkan presisi bobot dari FP16 (2 byte/parameter) ke INT8 (1 byte) atau INT4 (0,5 byte), memangkas kebutuhan VRAM 50-75 %. Ini memungkinkan menjalankan model 70B di hardware lebih murah atau menampung model lebih besar di GPU yang sama. Kuantisasi INT4 (GGUF Q4, AWQ, GPTQ) menurunkan kualitas 1-5 % di sebagian besar benchmark — masih dapat diterima untuk banyak kasus produksi.

Estimasi didasarkan pada angka benchmark publik per model di hardware H100 SXM, diskalakan menurut jumlah GPU dan utilisasi. Throughput nyata bergantung pada framework serving Anda (vLLM, TGI, Ollama), ukuran batch, panjang konteks, dan konfigurasi hardware. Anggap ini sebagai estimasi orde besaran untuk perencanaan kapasitas.

Ya. Kalkulator berjalan sepenuhnya di browser Anda memakai JavaScript sisi klien. Pilihan model, volume pemakaian, biaya infrastruktur, dan semua hasil perhitungan diproses lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu akun dan tidak ada data yang disimpan. Perencanaan infrastruktur Anda tetap sepenuhnya privat dan aman.