Kalkulator Biaya RAG
Estimasi gratis dan online biaya lengkap pipeline Retrieval-Augmented Generation. Hitung ingest embedding, reindeks, pengambilan per kueri, generasi LLM, biaya reranker opsional, dan penyimpanan basis data vektor — di OpenAI, Anthropic, Google, Cohere, Voyage, dan lainnya. Sepenuhnya privat, berjalan di browser Anda.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
Empat lapisan biaya pipeline RAG
Sistem RAG tidak ditagih sebagai satu panggilan. Ada ingest, kueri, generasi, dan penyimpanan, dan setiap lapisan punya harga sendiri.
Generasi LLM biasanya mendominasi karena mengirim potongan yang diambil sebagai konteks pada setiap jawaban.
- Ingest: embeed seluruh korpus sekali lalu reindeks berkala.
- Kueri: embeed setiap pertanyaan sebelum pencarian vektor.
- Generasi: kirim konteks yang diambil dan hasilkan jawaban.
- Penyimpanan: bayar indeks vektor sesuai ukurannya.
Chunk, top-k, dan reranking
Ukuran chunk memengaruhi akurasi sekaligus tagihan. Chunk lebih kecil memberi konteks lebih sedikit, tetapi butuh mengambil lebih banyak hasil.
- Chunk lebih kecil menurunkan biaya konteks per kueri.
- Top-k lebih tinggi menutup kehilangan konteks, tapi menambah token.
- Reranker meningkatkan akurasi dengan biaya per kueri.
Membandingkan penyedia dan merencanakan pengeluaran
Harga embedding sangat bervariasi antar penyedia untuk kualitas serupa. Bandingkan biaya dan kualitas sebelum menetapkan pipeline Anda.
- Estimasi korpus, jumlah dokumen, dan volume kueri Anda.
- Pilih model embedding berdasarkan biaya dan dimensi.
- Tetapkan ukuran chunk dan top-k sesuai hasil uji kualitas.
- Proyeksikan pengeluaran bulanan termasuk reindeks dan penyimpanan.
Pertanyaan yang Sering Diajukan
Alat ini memperkirakan total biaya menjalankan pipeline Retrieval-Augmented Generation — termasuk embedding basis pengetahuan, reindeks berkala, embedding per kueri, reranking, generasi LLM, dan penyimpanan basis data vektor. Berbeda dari alat biaya token sederhana, kalkulator ini mencakup setiap lapisan penagihan sistem RAG produksi.
Pipeline RAG punya empat lapisan biaya utama: (1) embedding ingest — embeed semua dokumen sekali lalu embeed ulang sesuai jadwal; (2) embedding kueri — embeed setiap kueri pengguna sebelum pencarian vektor; (3) generasi LLM — biaya dominan, mengirim potongan yang diambil sebagai konteks; dan (4) biaya penyimpanan basis data vektor opsional sesuai ukuran indeks.
Chunk lebih kecil (200-400 token) menurunkan biaya konteks LLM per kueri karena setiap potongan yang diambil menyumbang token input lebih sedikit. Namun, chunk kecil bisa butuh top-k lebih tinggi agar konteks cukup. Gunakan kalkulator ini untuk menyimulasikan berbagai ukuran chunk dan nilai top-k dan menemukan konfigurasi biaya optimal.
Biaya reindeks adalah pengeluaran untuk embeed ulang seluruh basis pengetahuan Anda pada frekuensi yang ditentukan. Misalnya, jika Anda reindeks setiap 30 hari dan total biaya ingest US$ 5,00, biaya reindeks bulanan adalah US$ 5,00. Kalkulator membagi periode proyeksi dengan interval reindeks untuk menentukan jumlah siklus re-embedding penuh.
Biaya penyimpanan vektor dihitung sebagai (jumlah dokumen × byte per vektor) + overhead metadata, dikonversi ke GB, lalu dikalikan tarif bulanan per GB. Byte per vektor bergantung pada dimensi model embedding (misalnya text-embedding-3-small: 1536 dim × 4 byte = 6.144 byte). Kalkulator menyertakan 40 byte metadata per vektor.
Kalkulator mendukung OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004), dan Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Semua tarif mencerminkan harga standar pay-as-you-go.
Ya. Kalkulator memproses semua perhitungan sepenuhnya di browser Anda. Jumlah dokumen, volume kueri, dan estimasi biaya dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak ada data yang keluar dari browser dan tidak perlu pendaftaran.