Lompat ke konten
Aback Tools Logo

Kalkulator VRAM

Estimasi kebutuhan VRAM GPU untuk inferensi LLM, fine-tuning penuh, pelatihan LoRA, dan kuantisasi GGUF. Hitung bobot model, cache KV, status optimizer, dan overhead framework dari prinsip dasar, lalu cek GPU mana yang cocok untuk beban kerja Anda. Gratis, instan, dan sepenuhnya privat.

VRAM Calculator

Estimate GPU VRAM requirements for LLM inference, full fine-tuning, LoRA training, and GGUF quantisation. Model weights, KV cache, activations, optimizer states, and framework overhead - all calculated from first principles in your browser.

32 layers · 8 KV heads · head dim 128

Model Architecture

B

Workload Mode

Weights + KV cache + minimal activations. Smallest footprint.

Weight Precision

Context & Batch

tokens
51264K128K
reqs
13264

Total VRAM Required

16.57 GB

for inference

8.03B params · FP16 · seq 4,096 · batch 1

Model Weights

14.96 GB

KV Cache

512 MB

Activations

31 MB

Overhead

1.08 GB

NVIDIA RTX 4090 (24 GB) (24 GB)

✅ Fits on a single GPU (69.0% VRAM used)

Single GPU ✓
VRAM Usage16.57 GB / 24 GB (69.0%)

On-prem dev/inference, small models

VRAM Breakdown

Model Weights14.96 GB (90.3%)
KV Cache512 MB (3.0%)
Activations31 MB (0.2%)
Framework Overhead1.08 GB (6.5%)

Precision Comparison (Same Config)

PrecisionWeightsTotal VRAMFits 24 GB?
FP3229.91 GB33.14 GB✗ No
FP16 Selected14.96 GB16.57 GB✓ Yes
BF1614.96 GB16.57 GB✓ Yes
FP87.48 GB8.55 GB✓ Yes
INT87.48 GB8.55 GB✓ Yes
INT43.74 GB4.54 GB✓ Yes

GPU Compatibility

GPUVRAMGPUs NeededStatus
NVIDIA RTX 4090 (24 GB)Selected
On-prem dev/inference, small models
24 GB1×Single GPU
NVIDIA A10G (24 GB)
Inference & ML serving
24 GB1×Single GPU
NVIDIA L4 (24 GB)
Cost-efficient inference
24 GB1×Single GPU
NVIDIA RTX 3090 (24 GB)
Budget on-prem inference
24 GB1×Single GPU
Apple M4 Pro (24 GB unified)
Mac inference, small models
24 GB1×Single GPU
NVIDIA A100 40 GB
Training medium models, inference
40 GB1×Single GPU
NVIDIA L40S (48 GB)
Inference, multi-modal workloads
48 GB1×Single GPU
NVIDIA A40 (48 GB)
Inference & fine-tuning
48 GB1×Single GPU
Apple M4 Max (48 GB unified)
Mac inference, light fine-tuning
48 GB1×Single GPU
NVIDIA H100 / H100 PCIe (80 GB)
LLM training & production inference
80 GB1×Single GPU
NVIDIA A100 80 GB
LLM fine-tuning & inference
80 GB1×Single GPU
AMD MI250X (128 GB)
Large-scale HPC & LLM training
128 GB1×Single GPU
Apple M4 Ultra (128 GB unified)
On-device Mac inference
128 GB1×Single GPU
NVIDIA H200 SXM (141 GB)
Largest LLM inference & training
141 GB1×Single GPU
AMD MI300X (192 GB)
Very large model inference & training
192 GB1×Single GPU
NVIDIA RTX 3080 (10 GB)
Small model inference only
10 GB2×2× Multi-GPU
NVIDIA RTX 4070 (12 GB)
Light inference, LoRA tuning
12 GB2×2× Multi-GPU
NVIDIA V100 (16 GB)
Legacy workloads
16 GB2×2× Multi-GPU
NVIDIA RTX 4080 (16 GB)
Consumer dev, small inference
16 GB2×2× Multi-GPU
Estimation Notes: VRAM estimates use the standard formula: weights × bytes/param + KV cache (2 × layers × KV-heads × head-dim × seq-len × batch × FP16 bytes) + framework overhead (7%). Training estimates include Adam optimizer states and gradients. Actual usage varies by runtime (vLLM, llama.cpp, Transformers), quantisation method, and model architecture specifics. Always leave 10-15% VRAM headroom. All calculations run locally in your browser.

Mengapa memakai kalkulator VRAM kami

Merencanakan perangkat keras LLM tanpa mengukur memori GPU sering berujung pada kartu yang berlebihan atau error kehabisan memori (OOM) saat dijalankan. Kalkulator ini memakai rumus VRAM yang sebenarnya, bukan aturan perkiraan, sehingga Anda bisa menentukan GPU dengan yakin sebelum menyewa atau membeli.

Pilih mode inferensi, fine-tuning penuh, pelatihan LoRA, dan kuantisasi GGUF: setiap mode memakai rumus yang tepat untuk beban kerja tersebut dan langsung memperbarui bobot, cache KV, status optimizer, serta overhead framework.

  • Perhitungan dari prinsip dasar: bobot, cache KV, aktivasi, status optimizer, gradien, dan overhead framework, bukan tebakan.
  • Sepenuhnya privat: konfigurasi Anda dihitung di browser dan tidak pernah dikirim ke server.
  • Mode inferensi, fine-tuning, LoRA, dan GGUF, masing-masing dengan rumus VRAM khusus.
  • Tabel kompatibilitas 19 GPU, termasuk H100, A100, RTX 4090, AMD MI300X, dan Apple Silicon.

Kasus penggunaan umum

Dari pemilihan perangkat keras hingga perencanaan pelatihan, inilah skenario ketika estimasi VRAM yang andal menghemat waktu dan biaya.

  • Memilih GPU untuk inferensi LLM: cek apakah model 70B muat di satu A100 80 GB atau butuh dua GPU.
  • Merencanakan fine-tuning: fine-tuning penuh dengan Adam sering butuh 3-6 kali memori inferensi.
  • Mengoptimalkan cache KV untuk konteks panjang: lihat berapa VRAM tambahan dari 4K ke 32K atau 128K token.
  • Memilih kuantisasi GGUF yang tepat: bandingkan Q4, Q5, dan Q8 serta kompromi kualitas dan memori.
  • Menjalankan model di perangkat konsumen: tahu model terkuantisasi mana yang muat di 12, 16, atau 24 GB VRAM.
  • Merencanakan anggaran pelatihan LoRA: lihat bagaimana rank yang dipilih memengaruhi kebutuhan memori.

Bagaimana VRAM dihitung dan batasannya

VRAM adalah memori kartu grafis, bukan RAM sistem: bobot, cache KV, aktivasi, dan buffer framework harus muat bersamaan dalam anggaran tetap ini. Kebutuhannya bergantung pada jumlah parameter, presisi numerik, panjang sekuens, ukuran batch, dan jenis beban kerja (inferensi, pelatihan, atau LoRA). Kami memakai rumus yang sama seperti yang diterapkan vLLM, Transformers, dan llama.cpp di dalamnya.

Kalkulator ini memberi estimasi tingkat rekayasa, bukan pengukuran pasti: pemakaian nyata bisa berbeda ±10-20 % tergantung runtime, implementasi model, perekaman CUDA graph, dan fragmentasi memori. Semua perhitungan berjalan lokal di browser Anda.

  1. Masukkan jumlah parameter dan presisi: model 7B dalam FP16 memakai sekitar 14 GB, dalam INT4 sekitar 3,5 GB.
  2. Tambahkan cache KV dari layer, kepala KV, dimensi kepala, panjang sekuens, dan batch; GQA sangat memangkasnya.
  3. Untuk pelatihan, tambahkan gradien dan status optimizer Adam: sekitar 12 byte tambahan per parameter pada fine-tuning penuh.
  4. Tambahkan overhead framework: kami menyisakan 7 % untuk PyTorch, CUDA, dan fragmentasi memori.

Pertanyaan yang Sering Diajukan

Kalkulator VRAM memperkirakan memori GPU yang dibutuhkan untuk memuat dan menjalankan model bahasa besar. Alat ini menghitung penyimpanan bobot model (parameter × byte per presisi), cache KV (dari panjang sekuens, ukuran batch, dan arsitektur attention), aktivasi, serta untuk pelatihan: status optimizer dan gradien. Semua berjalan di browser Anda tanpa mengunggah data.

Jumlah parameter biasanya ada di nama model (7B, 70B, 405B). Untuk nilai tepat, lihat file config.json model di Hugging Face pada kolom "num_parameters". Preset kami memuat jumlah parameter akurat untuk model populer seperti Llama 3.1, Qwen2.5, Mistral, dan Gemma 2.

Saat fine-tuning penuh, GPU harus menyimpan bobot model, tensor gradien berukuran sama, dan status optimizer Adam (momen pertama, momen kedua, serta bobot master FP32), yang menambah sekitar 12 byte per parameter. Untuk model 7B dalam BF16, inferensi butuh ~14 GB, sedangkan pelatihan penuh butuh ~60-80 GB.

Cache KV menyimpan kunci dan nilai attention dari semua token sebelumnya. Ukurannya = 2 × layer × kepala KV × dimensi kepala × panjang sekuens × ukuran batch × byte. Cache ini tumbuh linear dengan konteks: dari 4K ke 128K token menjadi 32 kali lipat. GQA mengurangi jumlah kepala KV dan memangkas ukuran cache secara signifikan.

Mode GGUF menghitung memori bobot sebagai parameter × (bit kuantisasi / 8) byte. Cache KV selalu disimpan dalam FP16, terlepas dari kuantisasi bobot. Q4_K_M (≈4 bit) adalah keseimbangan paling populer antara kualitas dan efisiensi memori bagi pengguna llama.cpp dan Ollama.

GQA mengurangi jumlah kepala key dan value menjadi sebagian kecil dari kepala query. Karena cache KV berskala dengan kepala KV, GQA dapat menguranginya 4 kali atau lebih. Llama 3.1 memakai 8 kepala KV dibanding 32 kepala query. Masukkan num_key_value_heads dari config.json untuk estimasi yang akurat.

Pada FP16, model 70B membutuhkan sekitar 140 GB hanya untuk bobot, dan muat di dua kartu H100 80 GB. Pada INT4, bobot turun ke ~35 GB sehingga muat di satu H100. Tabel kompatibilitas GPU menunjukkan jumlah GPU minimum untuk setiap kartu pada konfigurasi Anda.

Kalkulator memakai rumus teoretis standar yang menjadi dasar semua runtime. Paged attention di vLLM dapat menambah overhead 5-15 %. llama.cpp memetakan bobot ke memori dan bisa menjalankan model lebih besar. Buffer overhead 7 % mencakup sebagian besar perbedaan antar runtime. Selalu validasi dengan uji kecil sebelum produksi.

Ya. Kalkulator VRAM berjalan sepenuhnya di browser Anda. Parameter arsitektur, pilihan presisi, dan pengaturan konteks diproses secara lokal di perangkat Anda dan tidak pernah dikirim ke server. Tidak perlu akun atau pendaftaran.