Kalkulator VRAM
Estimasi kebutuhan VRAM GPU untuk inferensi LLM, fine-tuning penuh, pelatihan LoRA, dan kuantisasi GGUF. Hitung bobot model, cache KV, status optimizer, dan overhead framework dari prinsip dasar, lalu cek GPU mana yang cocok untuk beban kerja Anda. Gratis, instan, dan sepenuhnya privat.
Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.
32 layers · 8 KV heads · head dim 128
Model Architecture
Workload Mode
Weights + KV cache + minimal activations. Smallest footprint.
Weight Precision
Context & Batch
Total VRAM Required
for inference
8.03B params · FP16 · seq 4,096 · batch 1
Model Weights
14.96 GB
KV Cache
512 MB
Activations
31 MB
Overhead
1.08 GB
NVIDIA RTX 4090 (24 GB) (24 GB)
✅ Fits on a single GPU (69.0% VRAM used)
On-prem dev/inference, small models
VRAM Breakdown
Precision Comparison (Same Config)
| Precision | Weights | Total VRAM | Fits 24 GB? |
|---|---|---|---|
| FP32 | 29.91 GB | 33.14 GB | ✗ No |
| FP16 Selected | 14.96 GB | 16.57 GB | ✓ Yes |
| BF16 | 14.96 GB | 16.57 GB | ✓ Yes |
| FP8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT8 | 7.48 GB | 8.55 GB | ✓ Yes |
| INT4 | 3.74 GB | 4.54 GB | ✓ Yes |
GPU Compatibility
| GPU | VRAM | GPUs Needed | Status |
|---|---|---|---|
NVIDIA RTX 4090 (24 GB)Selected On-prem dev/inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A10G (24 GB) Inference & ML serving | 24 GB | 1× | Single GPU |
NVIDIA L4 (24 GB) Cost-efficient inference | 24 GB | 1× | Single GPU |
NVIDIA RTX 3090 (24 GB) Budget on-prem inference | 24 GB | 1× | Single GPU |
Apple M4 Pro (24 GB unified) Mac inference, small models | 24 GB | 1× | Single GPU |
NVIDIA A100 40 GB Training medium models, inference | 40 GB | 1× | Single GPU |
NVIDIA L40S (48 GB) Inference, multi-modal workloads | 48 GB | 1× | Single GPU |
NVIDIA A40 (48 GB) Inference & fine-tuning | 48 GB | 1× | Single GPU |
Apple M4 Max (48 GB unified) Mac inference, light fine-tuning | 48 GB | 1× | Single GPU |
NVIDIA H100 / H100 PCIe (80 GB) LLM training & production inference | 80 GB | 1× | Single GPU |
NVIDIA A100 80 GB LLM fine-tuning & inference | 80 GB | 1× | Single GPU |
AMD MI250X (128 GB) Large-scale HPC & LLM training | 128 GB | 1× | Single GPU |
Apple M4 Ultra (128 GB unified) On-device Mac inference | 128 GB | 1× | Single GPU |
NVIDIA H200 SXM (141 GB) Largest LLM inference & training | 141 GB | 1× | Single GPU |
AMD MI300X (192 GB) Very large model inference & training | 192 GB | 1× | Single GPU |
NVIDIA RTX 3080 (10 GB) Small model inference only | 10 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4070 (12 GB) Light inference, LoRA tuning | 12 GB | 2× | 2× Multi-GPU |
NVIDIA V100 (16 GB) Legacy workloads | 16 GB | 2× | 2× Multi-GPU |
NVIDIA RTX 4080 (16 GB) Consumer dev, small inference | 16 GB | 2× | 2× Multi-GPU |
Mengapa memakai kalkulator VRAM kami
Merencanakan perangkat keras LLM tanpa mengukur memori GPU sering berujung pada kartu yang berlebihan atau error kehabisan memori (OOM) saat dijalankan. Kalkulator ini memakai rumus VRAM yang sebenarnya, bukan aturan perkiraan, sehingga Anda bisa menentukan GPU dengan yakin sebelum menyewa atau membeli.
Pilih mode inferensi, fine-tuning penuh, pelatihan LoRA, dan kuantisasi GGUF: setiap mode memakai rumus yang tepat untuk beban kerja tersebut dan langsung memperbarui bobot, cache KV, status optimizer, serta overhead framework.
- Perhitungan dari prinsip dasar: bobot, cache KV, aktivasi, status optimizer, gradien, dan overhead framework, bukan tebakan.
- Sepenuhnya privat: konfigurasi Anda dihitung di browser dan tidak pernah dikirim ke server.
- Mode inferensi, fine-tuning, LoRA, dan GGUF, masing-masing dengan rumus VRAM khusus.
- Tabel kompatibilitas 19 GPU, termasuk H100, A100, RTX 4090, AMD MI300X, dan Apple Silicon.
Kasus penggunaan umum
Dari pemilihan perangkat keras hingga perencanaan pelatihan, inilah skenario ketika estimasi VRAM yang andal menghemat waktu dan biaya.
- Memilih GPU untuk inferensi LLM: cek apakah model 70B muat di satu A100 80 GB atau butuh dua GPU.
- Merencanakan fine-tuning: fine-tuning penuh dengan Adam sering butuh 3-6 kali memori inferensi.
- Mengoptimalkan cache KV untuk konteks panjang: lihat berapa VRAM tambahan dari 4K ke 32K atau 128K token.
- Memilih kuantisasi GGUF yang tepat: bandingkan Q4, Q5, dan Q8 serta kompromi kualitas dan memori.
- Menjalankan model di perangkat konsumen: tahu model terkuantisasi mana yang muat di 12, 16, atau 24 GB VRAM.
- Merencanakan anggaran pelatihan LoRA: lihat bagaimana rank yang dipilih memengaruhi kebutuhan memori.
Bagaimana VRAM dihitung dan batasannya
VRAM adalah memori kartu grafis, bukan RAM sistem: bobot, cache KV, aktivasi, dan buffer framework harus muat bersamaan dalam anggaran tetap ini. Kebutuhannya bergantung pada jumlah parameter, presisi numerik, panjang sekuens, ukuran batch, dan jenis beban kerja (inferensi, pelatihan, atau LoRA). Kami memakai rumus yang sama seperti yang diterapkan vLLM, Transformers, dan llama.cpp di dalamnya.
Kalkulator ini memberi estimasi tingkat rekayasa, bukan pengukuran pasti: pemakaian nyata bisa berbeda ±10-20 % tergantung runtime, implementasi model, perekaman CUDA graph, dan fragmentasi memori. Semua perhitungan berjalan lokal di browser Anda.
- Masukkan jumlah parameter dan presisi: model 7B dalam FP16 memakai sekitar 14 GB, dalam INT4 sekitar 3,5 GB.
- Tambahkan cache KV dari layer, kepala KV, dimensi kepala, panjang sekuens, dan batch; GQA sangat memangkasnya.
- Untuk pelatihan, tambahkan gradien dan status optimizer Adam: sekitar 12 byte tambahan per parameter pada fine-tuning penuh.
- Tambahkan overhead framework: kami menyisakan 7 % untuk PyTorch, CUDA, dan fragmentasi memori.
Pertanyaan yang Sering Diajukan
Kalkulator VRAM memperkirakan memori GPU yang dibutuhkan untuk memuat dan menjalankan model bahasa besar. Alat ini menghitung penyimpanan bobot model (parameter × byte per presisi), cache KV (dari panjang sekuens, ukuran batch, dan arsitektur attention), aktivasi, serta untuk pelatihan: status optimizer dan gradien. Semua berjalan di browser Anda tanpa mengunggah data.
Jumlah parameter biasanya ada di nama model (7B, 70B, 405B). Untuk nilai tepat, lihat file config.json model di Hugging Face pada kolom "num_parameters". Preset kami memuat jumlah parameter akurat untuk model populer seperti Llama 3.1, Qwen2.5, Mistral, dan Gemma 2.
Saat fine-tuning penuh, GPU harus menyimpan bobot model, tensor gradien berukuran sama, dan status optimizer Adam (momen pertama, momen kedua, serta bobot master FP32), yang menambah sekitar 12 byte per parameter. Untuk model 7B dalam BF16, inferensi butuh ~14 GB, sedangkan pelatihan penuh butuh ~60-80 GB.
Cache KV menyimpan kunci dan nilai attention dari semua token sebelumnya. Ukurannya = 2 × layer × kepala KV × dimensi kepala × panjang sekuens × ukuran batch × byte. Cache ini tumbuh linear dengan konteks: dari 4K ke 128K token menjadi 32 kali lipat. GQA mengurangi jumlah kepala KV dan memangkas ukuran cache secara signifikan.
Mode GGUF menghitung memori bobot sebagai parameter × (bit kuantisasi / 8) byte. Cache KV selalu disimpan dalam FP16, terlepas dari kuantisasi bobot. Q4_K_M (≈4 bit) adalah keseimbangan paling populer antara kualitas dan efisiensi memori bagi pengguna llama.cpp dan Ollama.
GQA mengurangi jumlah kepala key dan value menjadi sebagian kecil dari kepala query. Karena cache KV berskala dengan kepala KV, GQA dapat menguranginya 4 kali atau lebih. Llama 3.1 memakai 8 kepala KV dibanding 32 kepala query. Masukkan num_key_value_heads dari config.json untuk estimasi yang akurat.
Pada FP16, model 70B membutuhkan sekitar 140 GB hanya untuk bobot, dan muat di dua kartu H100 80 GB. Pada INT4, bobot turun ke ~35 GB sehingga muat di satu H100. Tabel kompatibilitas GPU menunjukkan jumlah GPU minimum untuk setiap kartu pada konfigurasi Anda.
Kalkulator memakai rumus teoretis standar yang menjadi dasar semua runtime. Paged attention di vLLM dapat menambah overhead 5-15 %. llama.cpp memetakan bobot ke memori dan bisa menjalankan model lebih besar. Buffer overhead 7 % mencakup sebagian besar perbedaan antar runtime. Selalu validasi dengan uji kecil sebelum produksi.
Ya. Kalkulator VRAM berjalan sepenuhnya di browser Anda. Parameter arsitektur, pilihan presisi, dan pengaturan konteks diproses secara lokal di perangkat Anda dan tidak pernah dikirim ke server. Tidak perlu akun atau pendaftaran.