Lompat ke konten
Aback Tools Logo

Kalkulator Biaya RAG

Estimasi gratis dan online biaya lengkap pipeline Retrieval-Augmented Generation. Hitung ingest embedding, reindeks, pengambilan per kueri, generasi LLM, biaya reranker opsional, dan penyimpanan basis data vektor — di OpenAI, Anthropic, Google, Cohere, Voyage, dan lainnya. Sepenuhnya privat, berjalan di browser Anda.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

Empat lapisan biaya pipeline RAG

Sistem RAG tidak ditagih sebagai satu panggilan. Ada ingest, kueri, generasi, dan penyimpanan, dan setiap lapisan punya harga sendiri.

Generasi LLM biasanya mendominasi karena mengirim potongan yang diambil sebagai konteks pada setiap jawaban.

  • Ingest: embeed seluruh korpus sekali lalu reindeks berkala.
  • Kueri: embeed setiap pertanyaan sebelum pencarian vektor.
  • Generasi: kirim konteks yang diambil dan hasilkan jawaban.
  • Penyimpanan: bayar indeks vektor sesuai ukurannya.

Chunk, top-k, dan reranking

Ukuran chunk memengaruhi akurasi sekaligus tagihan. Chunk lebih kecil memberi konteks lebih sedikit, tetapi butuh mengambil lebih banyak hasil.

  • Chunk lebih kecil menurunkan biaya konteks per kueri.
  • Top-k lebih tinggi menutup kehilangan konteks, tapi menambah token.
  • Reranker meningkatkan akurasi dengan biaya per kueri.

Membandingkan penyedia dan merencanakan pengeluaran

Harga embedding sangat bervariasi antar penyedia untuk kualitas serupa. Bandingkan biaya dan kualitas sebelum menetapkan pipeline Anda.

  1. Estimasi korpus, jumlah dokumen, dan volume kueri Anda.
  2. Pilih model embedding berdasarkan biaya dan dimensi.
  3. Tetapkan ukuran chunk dan top-k sesuai hasil uji kualitas.
  4. Proyeksikan pengeluaran bulanan termasuk reindeks dan penyimpanan.

Pertanyaan yang Sering Diajukan

Alat ini memperkirakan total biaya menjalankan pipeline Retrieval-Augmented Generation — termasuk embedding basis pengetahuan, reindeks berkala, embedding per kueri, reranking, generasi LLM, dan penyimpanan basis data vektor. Berbeda dari alat biaya token sederhana, kalkulator ini mencakup setiap lapisan penagihan sistem RAG produksi.

Pipeline RAG punya empat lapisan biaya utama: (1) embedding ingest — embeed semua dokumen sekali lalu embeed ulang sesuai jadwal; (2) embedding kueri — embeed setiap kueri pengguna sebelum pencarian vektor; (3) generasi LLM — biaya dominan, mengirim potongan yang diambil sebagai konteks; dan (4) biaya penyimpanan basis data vektor opsional sesuai ukuran indeks.

Chunk lebih kecil (200-400 token) menurunkan biaya konteks LLM per kueri karena setiap potongan yang diambil menyumbang token input lebih sedikit. Namun, chunk kecil bisa butuh top-k lebih tinggi agar konteks cukup. Gunakan kalkulator ini untuk menyimulasikan berbagai ukuran chunk dan nilai top-k dan menemukan konfigurasi biaya optimal.

Biaya reindeks adalah pengeluaran untuk embeed ulang seluruh basis pengetahuan Anda pada frekuensi yang ditentukan. Misalnya, jika Anda reindeks setiap 30 hari dan total biaya ingest US$ 5,00, biaya reindeks bulanan adalah US$ 5,00. Kalkulator membagi periode proyeksi dengan interval reindeks untuk menentukan jumlah siklus re-embedding penuh.

Biaya penyimpanan vektor dihitung sebagai (jumlah dokumen × byte per vektor) + overhead metadata, dikonversi ke GB, lalu dikalikan tarif bulanan per GB. Byte per vektor bergantung pada dimensi model embedding (misalnya text-embedding-3-small: 1536 dim × 4 byte = 6.144 byte). Kalkulator menyertakan 40 byte metadata per vektor.

Kalkulator mendukung OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004), dan Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Semua tarif mencerminkan harga standar pay-as-you-go.

Ya. Kalkulator memproses semua perhitungan sepenuhnya di browser Anda. Jumlah dokumen, volume kueri, dan estimasi biaya dihitung lokal di perangkat Anda dan tidak pernah dikirim ke server mana pun. Tidak ada data yang keluar dari browser dan tidak perlu pendaftaran.