Lompat ke konten
Aback Tools Logo

Kalkulator Ukuran Knowledge Base

Estimasi kebutuhan penyimpanan, ukuran indeks vektor, dan biaya ingest embedding untuk knowledge base AI Anda. Atur jumlah dokumen, panjang rata-rata, ukuran chunk, dan tumpang tindih untuk melihat total chunk dan ukuran indeks dalam GB. Bandingkan 9 model embedding dan 7 basis data vektor, lalu proyeksikan pertumbuhan penyimpanan dan biaya dari 1 hingga 60 bulan.

Knowledge Base Size Calculator

Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.

Dimensions: 1,536Vector size: 6.1 KBEmbed cost: $0.020/1M tokens

Document Corpus

docs
words

Chunking Strategy

tokens
tokens
Tokens per document667
Chunks per document2
Total chunks (initial)20,000

Vector Database Storage

bytes

Growth & Re-indexing

% / mo
months
days

Current Knowledge Base Snapshot

Total Chunks

20,000

2 per doc

Index Storage

0.120 GB

6.3 KB / chunk

Ingestion Cost

$0.2048

one-time embed

Storage / Month

$0.0397

0.12 GB

Storage Breakdown per Chunk

Vector (1,536d × 4 bytes)6.0 KB (95%)
Vector overhead (ID, pointers)60 B (1%)
Metadata (source, title, timestamps)256 B (4%)
Total per chunk6.3 KB

Growth Projection (12 months, 10%/mo)

MonthTotal DocsTotal ChunksIndex SizeStorage/MoNew Embed Cost
Mo 111,00022,0000.132 GB$0.0437$0.0205
Mo 212,10024,2000.146 GB$0.0480$0.0225
Mo 313,31026,6200.160 GB$0.0529$0.0248
Mo 414,64129,2820.176 GB$0.0581$0.0273
Mo 516,10532,2100.194 GB$0.0639$0.0300
Mo 617,71635,4320.213 GB$0.0703$0.0330
Mo 719,48838,9760.234 GB$0.0774$0.0363
Mo 821,43742,8740.258 GB$0.0851$0.0399
Mo 923,58147,1620.284 GB$0.0936$0.0439
Mo 1025,93951,8780.312 GB$0.1030$0.0483
Mo 1128,53357,0660.343 GB$0.1133$0.0531
Mo 12 Final31,38662,7720.378 GB$0.1246$0.0584

12-Month Total Cost Summary

Initial Ingestion

$0.2048

one-time embed cost

Growth Ingestion

$0.4380

new docs over 12 mo

Re-index Cost

$7.82

every 30 days

Storage (period)

$0.9341

12 mo accumulated

Final Index Size

0.378 GB

62,772 total chunks

Total Period Cost

$9.09

all costs combined

Embedding Model Comparison (initial ingestion)

ModelDimsVector SizeIndex SizeIngestion Cost
text-embedding-3-smallOpenAISelected
1,5366.1 KB0.120 GB$0.2048
text-embedding-3-largeOpenAI
3,07212.1 KB0.235 GB$1.33
text-embedding-ada-002OpenAI
1,5366.1 KB0.120 GB$1.02
embed-english-v3Cohere
1,0244.1 KB0.082 GB$1.02
embed-multilingual-v3Cohere
1,0244.1 KB0.082 GB$1.02
text-embedding-004Google
7683.1 KB0.063 GB$0.2560
voyage-3-liteVoyage
5122.1 KB0.044 GB$0.2048
voyage-3Voyage
1,0244.1 KB0.082 GB$0.6144
voyage-3-largeVoyage
2,0488.1 KB0.158 GB$1.84
Estimation Notes: Document token count uses 0.75 words/token ratio (standard English prose). Vector storage uses float32 (4 bytes/dimension) plus 60 bytes overhead per vector for IDs and pointers. Actual storage may vary by vector database compression, HNSW index overhead (typically +25-50%), and payload indexing. Storage rates are indicative list prices - actual billing depends on plan tier, region, and committed capacity. All calculations run locally in your browser.

Bagaimana penyimpanan vektor menumpuk

Ukuran indeks bergantung pada berapa banyak chunk yang dihasilkan korpus Anda dan dimensi model embedding yang dipilih. Setiap chunk menghasilkan vektor yang disimpan di basis data vektor.

Rumus dasarnya: dimensi × 4 byte per vektor, ditambah overhead tetap dan metadata terkait.

  • Chunk = dokumen × panjang rata-rata ÷ ukuran chunk, disesuaikan tumpang tindih.
  • Vektor float32: dimensi × 4 byte masing-masing.
  • Metadata per chunk (URL, tanggal, judul) menambah byte tambahan.

Memilih chunking dan model

Ukuran chunk adalah keseimbangan antara presisi pengambilan dan biaya penyimpanan serta ingest. Model menentukan dimensi sekaligus harga per juta token.

  1. Pilih ukuran chunk sesuai kepadatan dokumen Anda.
  2. Tambahkan tumpang tindih agar konteks di batas tidak hilang.
  3. Pilih model embedding berdasarkan rasio biaya-kualitas.
  4. Terapkan faktor overhead HNSW basis data vektor Anda.

Memproyeksikan pertumbuhan dan reindeks

Penyimpanan dan biaya bertambah dengan setiap dokumen baru. Proyeksi 1-60 bulan membantu merancang infrastruktur sebelum menjadi masalah.

  • Pertumbuhan bulanan melipatgandakan chunk, vektor, dan penyimpanan.
  • Reindeks hanya saat ganti model atau strategi chunking.
  • Pembaruan dokumen lebih baik ditangani dengan indeks inkremental.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan penyimpanan indeks vektor, jumlah chunk, biaya ingest embedding, dan proyeksi pertumbuhan bulanan untuk sistem RAG dan pencarian semantik. Alat ini memodelkan berapa banyak chunk yang dihasilkan korpus dokumen Anda, berapa penyimpanan yang dibutuhkan setiap chunk di basis data vektor, dan bagaimana biaya ingest serta penyimpanan bertambah seiring basis pengetahuan tumbuh.

Setiap chunk dokumen menghasilkan satu vektor embedding. Ukuran vektor = jumlah dimensi × 4 byte (encoding float32) ditambah sekitar 60 byte overhead per vektor untuk ID internal dan pointer graf. Metadata yang disimpan bersama tiap vektor (URL sumber, stempel waktu, judul dokumen) menambah byte tambahan per chunk.

Titik awal umum adalah 256-512 token untuk dokumen faktual padat dan 512-1024 token untuk konten naratif lebih panjang. Chunk lebih kecil menghasilkan lebih banyak vektor dan presisi pengambilan lebih tinggi, tetapi menambah penyimpanan dan biaya embedding. Gunakan kalkulator ini untuk membandingkan total penyimpanan di berbagai ukuran chunk sebelum menetapkan pipeline ingest.

Tumpang tindih adalah jumlah token yang dibagi antar chunk bersebelahan untuk menjaga konteks di batas. Tumpang tindih 64 token pada chunk 512 berarti setiap chunk berbagi 64 token dengan chunk berikutnya. Tumpang tindih menambah chunk ekstra pada total. Kalkulator memperhitungkannya saat menghitung total chunk dan penyimpanan.

Kalkulator menampilkan penyimpanan mentah vektor + metadata. Sebagian besar basis data vektor menambahkan overhead indeks graf HNSW 25-60 % di atas penyimpanan mentah. Rencanakan 1,3-1,6× dari estimasi penyimpanan mentah untuk basis data vektor terkelola dengan indeks HNSW bawaan.

Reindeks penuh hanya diperlukan saat Anda mengganti model embedding, menyesuaikan strategi chunking, atau melakukan restrukturisasi dokumen besar. Untuk pembaruan dan penambahan dokumen, indeks inkremental jauh lebih hemat. Kolom biaya reindeks memperkirakan siklus re-embedding penuh terjadwal.

Untuk sebagian besar aplikasi RAG berbahasa Inggris, Google text-embedding-004 (US$ 0,025/1M token, 768 dimensi) atau Voyage voyage-3-lite (US$ 0,020/1M token, 512 dimensi) memberi rasio biaya-kualitas terbaik untuk ingest skala besar. OpenAI text-embedding-3-small juga hemat di US$ 0,020/1M dengan 1536 dimensi.

Ya. Kalkulator berjalan sepenuhnya di browser Anda memakai JavaScript. Jumlah dokumen, deskripsi korpus, estimasi biaya, dan proyeksi pertumbuhan dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu pendaftaran dan alat ini sepenuhnya gratis.