Kalkulator Ukuran Knowledge Base
Estimasi kebutuhan penyimpanan, ukuran indeks vektor, dan biaya ingest embedding untuk knowledge base AI Anda. Atur jumlah dokumen, panjang rata-rata, ukuran chunk, dan tumpang tindih untuk melihat total chunk dan ukuran indeks dalam GB. Bandingkan 9 model embedding dan 7 basis data vektor, lalu proyeksikan pertumbuhan penyimpanan dan biaya dari 1 hingga 60 bulan.
Estimate knowledge base storage requirements, vector index size, ingestion costs, and monthly growth projections for RAG and AI search pipelines. All calculations run locally in your browser.
Document Corpus
Chunking Strategy
Vector Database Storage
Growth & Re-indexing
Current Knowledge Base Snapshot
Total Chunks
20,000
2 per doc
Index Storage
0.120 GB
6.3 KB / chunk
Ingestion Cost
$0.2048
one-time embed
Storage / Month
$0.0397
0.12 GB
Storage Breakdown per Chunk
Growth Projection (12 months, 10%/mo)
| Month | Total Docs | Total Chunks | Index Size | Storage/Mo | New Embed Cost |
|---|---|---|---|---|---|
| Mo 1 | 11,000 | 22,000 | 0.132 GB | $0.0437 | $0.0205 |
| Mo 2 | 12,100 | 24,200 | 0.146 GB | $0.0480 | $0.0225 |
| Mo 3 | 13,310 | 26,620 | 0.160 GB | $0.0529 | $0.0248 |
| Mo 4 | 14,641 | 29,282 | 0.176 GB | $0.0581 | $0.0273 |
| Mo 5 | 16,105 | 32,210 | 0.194 GB | $0.0639 | $0.0300 |
| Mo 6 | 17,716 | 35,432 | 0.213 GB | $0.0703 | $0.0330 |
| Mo 7 | 19,488 | 38,976 | 0.234 GB | $0.0774 | $0.0363 |
| Mo 8 | 21,437 | 42,874 | 0.258 GB | $0.0851 | $0.0399 |
| Mo 9 | 23,581 | 47,162 | 0.284 GB | $0.0936 | $0.0439 |
| Mo 10 | 25,939 | 51,878 | 0.312 GB | $0.1030 | $0.0483 |
| Mo 11 | 28,533 | 57,066 | 0.343 GB | $0.1133 | $0.0531 |
| Mo 12 Final | 31,386 | 62,772 | 0.378 GB | $0.1246 | $0.0584 |
12-Month Total Cost Summary
Initial Ingestion
$0.2048
one-time embed cost
Growth Ingestion
$0.4380
new docs over 12 mo
Re-index Cost
$7.82
every 30 days
Storage (period)
$0.9341
12 mo accumulated
Final Index Size
0.378 GB
62,772 total chunks
Total Period Cost
$9.09
all costs combined
Embedding Model Comparison (initial ingestion)
| Model | Dims | Vector Size | Index Size | Ingestion Cost |
|---|---|---|---|---|
text-embedding-3-smallOpenAISelected | 1,536 | 6.1 KB | 0.120 GB | $0.2048 |
text-embedding-3-largeOpenAI | 3,072 | 12.1 KB | 0.235 GB | $1.33 |
text-embedding-ada-002OpenAI | 1,536 | 6.1 KB | 0.120 GB | $1.02 |
embed-english-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
embed-multilingual-v3Cohere | 1,024 | 4.1 KB | 0.082 GB | $1.02 |
text-embedding-004Google | 768 | 3.1 KB | 0.063 GB | $0.2560 |
voyage-3-liteVoyage | 512 | 2.1 KB | 0.044 GB | $0.2048 |
voyage-3Voyage | 1,024 | 4.1 KB | 0.082 GB | $0.6144 |
voyage-3-largeVoyage | 2,048 | 8.1 KB | 0.158 GB | $1.84 |
Bagaimana penyimpanan vektor menumpuk
Ukuran indeks bergantung pada berapa banyak chunk yang dihasilkan korpus Anda dan dimensi model embedding yang dipilih. Setiap chunk menghasilkan vektor yang disimpan di basis data vektor.
Rumus dasarnya: dimensi × 4 byte per vektor, ditambah overhead tetap dan metadata terkait.
- Chunk = dokumen × panjang rata-rata ÷ ukuran chunk, disesuaikan tumpang tindih.
- Vektor float32: dimensi × 4 byte masing-masing.
- Metadata per chunk (URL, tanggal, judul) menambah byte tambahan.
Memilih chunking dan model
Ukuran chunk adalah keseimbangan antara presisi pengambilan dan biaya penyimpanan serta ingest. Model menentukan dimensi sekaligus harga per juta token.
- Pilih ukuran chunk sesuai kepadatan dokumen Anda.
- Tambahkan tumpang tindih agar konteks di batas tidak hilang.
- Pilih model embedding berdasarkan rasio biaya-kualitas.
- Terapkan faktor overhead HNSW basis data vektor Anda.
Memproyeksikan pertumbuhan dan reindeks
Penyimpanan dan biaya bertambah dengan setiap dokumen baru. Proyeksi 1-60 bulan membantu merancang infrastruktur sebelum menjadi masalah.
- Pertumbuhan bulanan melipatgandakan chunk, vektor, dan penyimpanan.
- Reindeks hanya saat ganti model atau strategi chunking.
- Pembaruan dokumen lebih baik ditangani dengan indeks inkremental.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan penyimpanan indeks vektor, jumlah chunk, biaya ingest embedding, dan proyeksi pertumbuhan bulanan untuk sistem RAG dan pencarian semantik. Alat ini memodelkan berapa banyak chunk yang dihasilkan korpus dokumen Anda, berapa penyimpanan yang dibutuhkan setiap chunk di basis data vektor, dan bagaimana biaya ingest serta penyimpanan bertambah seiring basis pengetahuan tumbuh.
Setiap chunk dokumen menghasilkan satu vektor embedding. Ukuran vektor = jumlah dimensi × 4 byte (encoding float32) ditambah sekitar 60 byte overhead per vektor untuk ID internal dan pointer graf. Metadata yang disimpan bersama tiap vektor (URL sumber, stempel waktu, judul dokumen) menambah byte tambahan per chunk.
Titik awal umum adalah 256-512 token untuk dokumen faktual padat dan 512-1024 token untuk konten naratif lebih panjang. Chunk lebih kecil menghasilkan lebih banyak vektor dan presisi pengambilan lebih tinggi, tetapi menambah penyimpanan dan biaya embedding. Gunakan kalkulator ini untuk membandingkan total penyimpanan di berbagai ukuran chunk sebelum menetapkan pipeline ingest.
Tumpang tindih adalah jumlah token yang dibagi antar chunk bersebelahan untuk menjaga konteks di batas. Tumpang tindih 64 token pada chunk 512 berarti setiap chunk berbagi 64 token dengan chunk berikutnya. Tumpang tindih menambah chunk ekstra pada total. Kalkulator memperhitungkannya saat menghitung total chunk dan penyimpanan.
Kalkulator menampilkan penyimpanan mentah vektor + metadata. Sebagian besar basis data vektor menambahkan overhead indeks graf HNSW 25-60 % di atas penyimpanan mentah. Rencanakan 1,3-1,6× dari estimasi penyimpanan mentah untuk basis data vektor terkelola dengan indeks HNSW bawaan.
Reindeks penuh hanya diperlukan saat Anda mengganti model embedding, menyesuaikan strategi chunking, atau melakukan restrukturisasi dokumen besar. Untuk pembaruan dan penambahan dokumen, indeks inkremental jauh lebih hemat. Kolom biaya reindeks memperkirakan siklus re-embedding penuh terjadwal.
Untuk sebagian besar aplikasi RAG berbahasa Inggris, Google text-embedding-004 (US$ 0,025/1M token, 768 dimensi) atau Voyage voyage-3-lite (US$ 0,020/1M token, 512 dimensi) memberi rasio biaya-kualitas terbaik untuk ingest skala besar. OpenAI text-embedding-3-small juga hemat di US$ 0,020/1M dengan 1536 dimensi.
Ya. Kalkulator berjalan sepenuhnya di browser Anda memakai JavaScript. Jumlah dokumen, deskripsi korpus, estimasi biaya, dan proyeksi pertumbuhan dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak perlu pendaftaran dan alat ini sepenuhnya gratis.