Calculateur de coûts RAG
Estimez gratuitement en ligne le coût complet d'un pipeline de génération augmentée par récupération. Calculez l'ingestion d'embeddings, la ré-indexation, la récupération par requête, la génération LLM, les frais de reranker optionnels et le stockage en base vectorielle - sur OpenAI, Anthropic, Google, Cohere, Voyage et plus. Totalement privé, dans votre navigateur.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
Les quatre couches de coût d'un pipeline RAG
Un système RAG ne se facture pas comme un seul appel. Il y a l'ingestion, la requête, la génération et le stockage, et chaque couche a son propre prix.
La génération LLM domine souvent, car elle envoie les segments récupérés comme contexte à chaque réponse.
- Ingestion : embedder tout le corpus une fois, puis ré-indexer périodiquement.
- Requête : embedder chaque question avant la recherche vectorielle.
- Génération : envoyer le contexte récupéré et produire la réponse.
- Stockage : payer l'index vectoriel selon sa taille.
Segments, top-k et reranking
La taille des segments conditionne à la fois la précision et la facture. Des segments plus petits apportent moins de contexte mais nécessitent de récupérer plus de résultats.
- Des segments plus petits réduisent le coût de contexte par requête.
- Un top-k plus élevé compense la perte de contexte mais ajoute des tokens.
- Le reranker améliore la précision contre des frais par requête.
Comparer les fournisseurs et prévoir les dépenses
Les prix des embeddings varient beaucoup entre fournisseurs à qualité comparable. Comparez le rapport coût/qualité avant de figer votre pipeline.
- Estimez votre corpus, votre nombre de documents et votre volume de requêtes.
- Choisissez le modèle d'embeddings selon le coût et les dimensions.
- Définissez taille de segment et top-k selon vos tests de qualité.
- Projetez la dépense mensuelle incluant ré-indexation et stockage.
Foire aux questions
Il estime le coût total d'exploitation d'un pipeline de génération augmentée par récupération : embedding de la base de connaissances, ré-indexation périodique, embedding par requête, reranking, génération LLM et stockage vectoriel. Contrairement à un simple outil de coût par token, il couvre chaque couche de facturation d'un système RAG en production.
Les pipelines RAG ont quatre couches principales : (1) embedding d'ingestion - embedder tous les documents une fois et re-embedder selon un calendrier ; (2) embedding de requête - embedder chaque requête utilisateur avant la recherche vectorielle ; (3) génération LLM - le coût dominant, en envoyant les segments récupérés comme contexte ; et (4) frais optionnels de stockage en base vectorielle selon la taille de l'index.
Des segments plus petits (200-400 tokens) réduisent le coût de contexte LLM par requête, chaque segment récupéré apportant moins de tokens d'entrée. En revanche, ils peuvent exiger un top-k plus élevé pour capturer assez de contexte. Utilisez ce calculateur pour simuler différentes tailles de segments et valeurs de top-k et trouver la configuration optimale.
Le coût de ré-indexation est la dépense consistant à re-embedder toute votre base de connaissances à la fréquence indiquée. Par exemple, si vous ré-indexez tous les 30 jours et que le coût d'ingestion total est de 5,00 $, le coût mensuel de ré-indexation est de 5,00 $. Le calculateur divise votre période de prévision par l'intervalle de ré-indexation pour déterminer le nombre de cycles complets.
Le coût de stockage vectoriel est calculé comme (nombre de documents × octets par vecteur) + surcoût métadonnées, converti en Go, puis multiplié par le tarif mensuel par Go. Les octets par vecteur dépendent des dimensions du modèle d'embeddings (ex. text-embedding-3-small : 1536 dim × 4 octets = 6 144 octets). Le calculateur inclut 40 octets de métadonnées par vecteur.
Le calculateur prend en charge OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) et Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Tous les tarifs reflètent les prix standard Pay-As-You-Go.
Oui. Tous les calculs s'effectuent entièrement dans votre navigateur. Vos nombres de documents, volumes de requêtes et estimations de coûts sont calculés localement sur votre appareil et jamais transmis à un serveur. Aucune donnée ne quitte votre navigateur et aucune inscription n'est requise.