Zum Inhalt springen
Aback Tools Logo

RAG-Kostenrechner

Schätzen Sie kostenlos online die Gesamtkosten einer Retrieval-Augmented-Generation-Pipeline. Berechnen Sie Embedding-Ingestion, Re-Indexierung, Abruf pro Anfrage, LLM-Generierung, optionale Reranker-Gebühren und Vektordatenbank-Speicher – über OpenAI, Anthropic, Google, Cohere, Voyage und mehr. Vollständig privat, im Browser.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

Die vier Kostenebenen einer RAG-Pipeline

Ein RAG-System wird nicht als einzelner Aufruf abgerechnet. Es gibt Ingestion, Abfrage, Generierung und Speicherung – jede Ebene hat ihren Preis.

Die LLM-Generierung dominiert meist, weil sie bei jeder Antwort abgerufene Chunks als Kontext sendet.

  • Ingestion: den gesamten Korpus einmal embedden und regelmäßig re-indexieren.
  • Abfrage: jede Frage vor der Vektorsuche embedden.
  • Generierung: den abgerufenen Kontext senden und die Antwort erzeugen.
  • Speicherung: für den Vektorindex nach seiner Größe zahlen.

Chunks, Top-k und Reranking

Die Chunk-Größe beeinflusst sowohl Präzision als auch Rechnung. Kleinere Chunks liefern weniger Kontext, erfordern aber mehr abgerufene Ergebnisse.

  • Kleinere Chunks senken die Kontextkosten pro Anfrage.
  • Ein höheres Top-k gleicht Kontextverlust aus, kostet aber Tokens.
  • Ein Reranker verbessert die Präzision gegen eine Gebühr pro Anfrage.

Anbieter vergleichen und Ausgaben planen

Embedding-Preise unterscheiden sich bei ähnlicher Qualität stark zwischen Anbietern. Vergleichen Sie Kosten und Qualität, bevor Sie Ihre Pipeline festlegen.

  1. Schätzen Sie Korpus, Dokumentanzahl und Abfragevolumen.
  2. Wählen Sie das Embedding-Modell nach Kosten und Dimensionen.
  3. Legen Sie Chunk-Größe und Top-k gemäß Ihren Qualitätstests fest.
  4. Projizieren Sie die Monatsausgaben inklusive Re-Indexierung und Speicher.

Häufig gestellte Fragen

Er schätzt die Gesamtkosten des Betriebs einer Retrieval-Augmented-Generation-Pipeline – einschließlich Embedding der Wissensbasis, periodischer Re-Indexierung, Embedding pro Anfrage, Reranking, LLM-Generierung und Vektordatenbank-Speicher. Anders als ein reines Token-Kostentool deckt er jede Abrechnungsebene eines Produktions-RAG-Systems ab.

RAG-Pipelines haben vier Hauptkostenebenen: (1) Ingestion-Embedding – alle Dokumente einmal embedden und planmäßig neu embedden; (2) Query-Embedding – jede Nutzeranfrage vor der Vektorsuche embedden; (3) LLM-Generierung – der dominierende Kostenfaktor, bei dem abgerufene Chunks als Kontext gesendet werden; und (4) optionale Speichergebühren der Vektordatenbank nach Indexgröße.

Kleinere Chunks (200-400 Tokens) senken die LLM-Kontextkosten pro Anfrage, da jeder abgerufene Chunk weniger Eingabe-Tokens beiträgt. Sie können jedoch ein höheres Top-k erfordern, um genug Kontext zu erfassen. Simulieren Sie mit diesem Rechner verschiedene Chunk-Größen und Top-k-Werte, um die optimale Kostenkonfiguration zu finden.

Die Re-Indexierungskosten sind der Aufwand, Ihre gesamte Wissensbasis in der angegebenen Frequenz neu zu embedden. Wenn Sie alle 30 Tage re-indexieren und die gesamten Ingestion-Kosten 5,00 $ betragen, liegen die monatlichen Re-Indexierungskosten bei 5,00 $. Der Rechner teilt Ihren Prognosezeitraum durch das Re-Index-Intervall, um die Anzahl vollständiger Re-Embedding-Zyklen zu bestimmen.

Die Vektorspeicherkosten werden berechnet als (Anzahl Dokumente × Bytes pro Vektor) + Metadaten-Overhead, in GB umgerechnet und mit dem Monatspreis pro GB multipliziert. Die Bytes pro Vektor hängen von den Dimensionen des Embedding-Modells ab (z. B. text-embedding-3-small: 1536 Dim × 4 Byte = 6.144 Byte). Der Rechner beinhaltet 40 Byte Metadaten-Overhead pro Vektor.

Der Rechner unterstützt OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) und Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Alle Tarife entsprechen Standard-Pay-as-you-go-Preisen.

Ja. Alle Berechnungen erfolgen vollständig im Browser. Dokumentanzahl, Abfragevolumen und Kostenschätzungen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen. Keine Daten verlassen den Browser, keine Registrierung nötig.