Aller au contenu
Aback Tools Logo

Calculateur de coûts RAG

Estimez gratuitement en ligne le coût complet d'un pipeline de génération augmentée par récupération. Calculez l'ingestion d'embeddings, la ré-indexation, la récupération par requête, la génération LLM, les frais de reranker optionnels et le stockage en base vectorielle - sur OpenAI, Anthropic, Google, Cohere, Voyage et plus. Totalement privé, dans votre navigateur.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

Les quatre couches de coût d'un pipeline RAG

Un système RAG ne se facture pas comme un seul appel. Il y a l'ingestion, la requête, la génération et le stockage, et chaque couche a son propre prix.

La génération LLM domine souvent, car elle envoie les segments récupérés comme contexte à chaque réponse.

  • Ingestion : embedder tout le corpus une fois, puis ré-indexer périodiquement.
  • Requête : embedder chaque question avant la recherche vectorielle.
  • Génération : envoyer le contexte récupéré et produire la réponse.
  • Stockage : payer l'index vectoriel selon sa taille.

Segments, top-k et reranking

La taille des segments conditionne à la fois la précision et la facture. Des segments plus petits apportent moins de contexte mais nécessitent de récupérer plus de résultats.

  • Des segments plus petits réduisent le coût de contexte par requête.
  • Un top-k plus élevé compense la perte de contexte mais ajoute des tokens.
  • Le reranker améliore la précision contre des frais par requête.

Comparer les fournisseurs et prévoir les dépenses

Les prix des embeddings varient beaucoup entre fournisseurs à qualité comparable. Comparez le rapport coût/qualité avant de figer votre pipeline.

  1. Estimez votre corpus, votre nombre de documents et votre volume de requêtes.
  2. Choisissez le modèle d'embeddings selon le coût et les dimensions.
  3. Définissez taille de segment et top-k selon vos tests de qualité.
  4. Projetez la dépense mensuelle incluant ré-indexation et stockage.

Foire aux questions

Il estime le coût total d'exploitation d'un pipeline de génération augmentée par récupération : embedding de la base de connaissances, ré-indexation périodique, embedding par requête, reranking, génération LLM et stockage vectoriel. Contrairement à un simple outil de coût par token, il couvre chaque couche de facturation d'un système RAG en production.

Les pipelines RAG ont quatre couches principales : (1) embedding d'ingestion - embedder tous les documents une fois et re-embedder selon un calendrier ; (2) embedding de requête - embedder chaque requête utilisateur avant la recherche vectorielle ; (3) génération LLM - le coût dominant, en envoyant les segments récupérés comme contexte ; et (4) frais optionnels de stockage en base vectorielle selon la taille de l'index.

Des segments plus petits (200-400 tokens) réduisent le coût de contexte LLM par requête, chaque segment récupéré apportant moins de tokens d'entrée. En revanche, ils peuvent exiger un top-k plus élevé pour capturer assez de contexte. Utilisez ce calculateur pour simuler différentes tailles de segments et valeurs de top-k et trouver la configuration optimale.

Le coût de ré-indexation est la dépense consistant à re-embedder toute votre base de connaissances à la fréquence indiquée. Par exemple, si vous ré-indexez tous les 30 jours et que le coût d'ingestion total est de 5,00 $, le coût mensuel de ré-indexation est de 5,00 $. Le calculateur divise votre période de prévision par l'intervalle de ré-indexation pour déterminer le nombre de cycles complets.

Le coût de stockage vectoriel est calculé comme (nombre de documents × octets par vecteur) + surcoût métadonnées, converti en Go, puis multiplié par le tarif mensuel par Go. Les octets par vecteur dépendent des dimensions du modèle d'embeddings (ex. text-embedding-3-small : 1536 dim × 4 octets = 6 144 octets). Le calculateur inclut 40 octets de métadonnées par vecteur.

Le calculateur prend en charge OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) et Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Tous les tarifs reflètent les prix standard Pay-As-You-Go.

Oui. Tous les calculs s'effectuent entièrement dans votre navigateur. Vos nombres de documents, volumes de requêtes et estimations de coûts sont calculés localement sur votre appareil et jamais transmis à un serveur. Aucune donnée ne quitte votre navigateur et aucune inscription n'est requise.