Lompat ke konten
Aback Tools Logo

Kalkulator Biaya AI Self-Hosted

Bandingkan biaya nyata self-host LLM open-source dengan penyedia API terkelola — gratis dan 100 % privat di browser Anda. Konfigurasikan beban kerja, pilih opsi infrastruktur GPU (RunPod, Vast.ai, Lambda, AWS, GCP, server sendiri), tambahkan overhead DevOps, dan dapatkan perbandingan bulanan berdampingan, biaya per juta token, pemeriksaan kapasitas throughput, dan periode balik modal server sendiri.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Biaya nyata melampaui harga GPU

Sewa per jam hanya bagian paling terlihat. Waktu engineering, jaringan, dan penyimpanan sering menambah 30 sampai 60 % ke biaya mentah.

Membandingkan hanya tarif GPU dengan harga per token API akan menghasilkan kesimpulan keliru.

  • GPU: tarif per jam × jam dalam sebulan.
  • DevOps: jam engineering × biaya penuh per jam.
  • Tambahan: jaringan, penyimpanan, dan penyiapan framework.

Utilisasi dan kuantisasi

Biaya efektif per token bergantung pada utilisasi sekaligus harga per jam. GPU yang setengah kosong melipatgandakan biaya satuan.

  • Utilisasi rendah = biaya per token proporsional lebih tinggi.
  • Batching dan vLLM meningkatkan utilisasi di produksi.
  • INT4/Q4 memangkas VRAM dan memungkinkan model lebih besar di GPU murah.

Kapan tiap opsi menang

Cloud menang untuk beban variabel atau proyek singkat. Hardware sendiri menang dengan pemakaian tinggi dan konstan selama bertahun-tahun.

  1. Estimasi token harian dan utilisasi berkelanjutan Anda.
  2. Hitung biaya bulanan self-host dengan GPU dan DevOps.
  3. Bandingkan dengan harga API terkelola untuk beban yang sama.
  4. Jika pemakaian stabil dan tinggi, hitung amortisasi server sendiri 3-4 tahun.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan total biaya bulanan menjalankan LLM open-source di infrastruktur GPU Anda sendiri — termasuk sewa GPU atau biaya hardware teramortisasi, tenaga kerja DevOps, dan overhead operasional — lalu membandingkannya dengan harga API terkelola untuk beban kerja yang sama.

Titik impas bergantung pada model, efisiensi GPU, dan overhead operasional. Untuk model kecil seperti Llama 3.1 8B, self-host kompetitif pada sekitar 500 ribu sampai 2 juta token/hari. Untuk model 70B, titik impasnya biasanya 5-20 juta token/hari.

Tarif per jam GPU hanya sebagian dari biaya nyata. Waktu engineering DevOps (US$ 500-3.000/bulan), jaringan, penyimpanan, dan penyiapan framework serving menambah 30-60 % di atas biaya GPU mentah. Selalu sertakan ini saat membandingkan dengan harga API.

Ini persentase komputasi GPU yang aktif memproses permintaan. Pada utilisasi 30 %, biaya efektif per token 3× lebih tinggi daripada pada 90 %. Batching permintaan dan framework seperti vLLM krusial untuk utilisasi tinggi dan daya saing ekonomi.

Kuantisasi (INT4/Q4) menurunkan kebutuhan VRAM sekitar 70 %, memungkinkan model lebih besar di GPU lebih murah. Kompensasinya: throughput turun 10-20 % dan kualitas sedikit menurun. Untuk sebagian besar beban inferensi produksi, ini trade-off yang baik saat VRAM menjadi hambatan.

Untuk deployment cloud satu model sederhana, anggarkan 5-20 jam/bulan waktu engineer. Pada tarif penuh US$ 80-150/jam, itu US$ 400-3.000/bulan. Mulai dengan 10-20 jam/bulan dan catat waktu nyata pada kuartal pertama untuk menyempurnakan proyeksi.

Ya. Kalkulator berjalan sepenuhnya di browser Anda. Volume beban kerja, pilihan infrastruktur, dan semua hasil diproses lokal di perangkat Anda dan tidak pernah dikirim ke server, disimpan, atau dibagikan. Tidak perlu login.

Untuk model kecil murah: Vast.ai (~US$ 0,35/jam RTX 4090) dan RunPod (~US$ 0,44/jam L4). Untuk inferensi produksi 7-13B: RunPod atau Lambda (A10G/A100 pada US$ 0,76-1,64/jam). Untuk model 70B+: RunPod H100 (US$ 3,49/jam). Untuk beban stabil yang hemat: hardware sendiri dengan amortisasi 3-4 tahun.