RAG-Kostenrechner
Schätzen Sie kostenlos online die Gesamtkosten einer Retrieval-Augmented-Generation-Pipeline. Berechnen Sie Embedding-Ingestion, Re-Indexierung, Abruf pro Anfrage, LLM-Generierung, optionale Reranker-Gebühren und Vektordatenbank-Speicher – über OpenAI, Anthropic, Google, Cohere, Voyage und mehr. Vollständig privat, im Browser.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
Die vier Kostenebenen einer RAG-Pipeline
Ein RAG-System wird nicht als einzelner Aufruf abgerechnet. Es gibt Ingestion, Abfrage, Generierung und Speicherung – jede Ebene hat ihren Preis.
Die LLM-Generierung dominiert meist, weil sie bei jeder Antwort abgerufene Chunks als Kontext sendet.
- Ingestion: den gesamten Korpus einmal embedden und regelmäßig re-indexieren.
- Abfrage: jede Frage vor der Vektorsuche embedden.
- Generierung: den abgerufenen Kontext senden und die Antwort erzeugen.
- Speicherung: für den Vektorindex nach seiner Größe zahlen.
Chunks, Top-k und Reranking
Die Chunk-Größe beeinflusst sowohl Präzision als auch Rechnung. Kleinere Chunks liefern weniger Kontext, erfordern aber mehr abgerufene Ergebnisse.
- Kleinere Chunks senken die Kontextkosten pro Anfrage.
- Ein höheres Top-k gleicht Kontextverlust aus, kostet aber Tokens.
- Ein Reranker verbessert die Präzision gegen eine Gebühr pro Anfrage.
Anbieter vergleichen und Ausgaben planen
Embedding-Preise unterscheiden sich bei ähnlicher Qualität stark zwischen Anbietern. Vergleichen Sie Kosten und Qualität, bevor Sie Ihre Pipeline festlegen.
- Schätzen Sie Korpus, Dokumentanzahl und Abfragevolumen.
- Wählen Sie das Embedding-Modell nach Kosten und Dimensionen.
- Legen Sie Chunk-Größe und Top-k gemäß Ihren Qualitätstests fest.
- Projizieren Sie die Monatsausgaben inklusive Re-Indexierung und Speicher.
Häufig gestellte Fragen
Er schätzt die Gesamtkosten des Betriebs einer Retrieval-Augmented-Generation-Pipeline – einschließlich Embedding der Wissensbasis, periodischer Re-Indexierung, Embedding pro Anfrage, Reranking, LLM-Generierung und Vektordatenbank-Speicher. Anders als ein reines Token-Kostentool deckt er jede Abrechnungsebene eines Produktions-RAG-Systems ab.
RAG-Pipelines haben vier Hauptkostenebenen: (1) Ingestion-Embedding – alle Dokumente einmal embedden und planmäßig neu embedden; (2) Query-Embedding – jede Nutzeranfrage vor der Vektorsuche embedden; (3) LLM-Generierung – der dominierende Kostenfaktor, bei dem abgerufene Chunks als Kontext gesendet werden; und (4) optionale Speichergebühren der Vektordatenbank nach Indexgröße.
Kleinere Chunks (200-400 Tokens) senken die LLM-Kontextkosten pro Anfrage, da jeder abgerufene Chunk weniger Eingabe-Tokens beiträgt. Sie können jedoch ein höheres Top-k erfordern, um genug Kontext zu erfassen. Simulieren Sie mit diesem Rechner verschiedene Chunk-Größen und Top-k-Werte, um die optimale Kostenkonfiguration zu finden.
Die Re-Indexierungskosten sind der Aufwand, Ihre gesamte Wissensbasis in der angegebenen Frequenz neu zu embedden. Wenn Sie alle 30 Tage re-indexieren und die gesamten Ingestion-Kosten 5,00 $ betragen, liegen die monatlichen Re-Indexierungskosten bei 5,00 $. Der Rechner teilt Ihren Prognosezeitraum durch das Re-Index-Intervall, um die Anzahl vollständiger Re-Embedding-Zyklen zu bestimmen.
Die Vektorspeicherkosten werden berechnet als (Anzahl Dokumente × Bytes pro Vektor) + Metadaten-Overhead, in GB umgerechnet und mit dem Monatspreis pro GB multipliziert. Die Bytes pro Vektor hängen von den Dimensionen des Embedding-Modells ab (z. B. text-embedding-3-small: 1536 Dim × 4 Byte = 6.144 Byte). Der Rechner beinhaltet 40 Byte Metadaten-Overhead pro Vektor.
Der Rechner unterstützt OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) und Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Alle Tarife entsprechen Standard-Pay-as-you-go-Preisen.
Ja. Alle Berechnungen erfolgen vollständig im Browser. Dokumentanzahl, Abfragevolumen und Kostenschätzungen werden lokal auf Ihrem Gerät berechnet und nie an einen Server übertragen. Keine Daten verlassen den Browser, keine Registrierung nötig.