Calculadora de custos de RAG
Estime grátis e online o custo completo de um pipeline de geração aumentada por recuperação. Calcule ingestão de embeddings, reindexação, recuperação por consulta, geração do LLM, taxas opcionais de reranker e armazenamento em banco de dados vetorial na OpenAI, Anthropic, Google, Cohere, Voyage e mais. Totalmente privado, roda no seu navegador.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
As quatro camadas de custo de um pipeline RAG
Um sistema RAG não é cobrado como uma única chamada. Há ingestão, consulta, geração e armazenamento, e cada camada tem seu preço.
A geração do LLM costuma dominar, pois envia os trechos recuperados como contexto em cada resposta.
- Ingestão: embeber o corpus completo uma vez e reindexar periodicamente.
- Consulta: embeber cada pergunta antes da busca vetorial.
- Geração: enviar o contexto recuperado e produzir a resposta.
- Armazenamento: pagar pelo índice vetorial conforme seu tamanho.
Chunks, top-k e reranking
O tamanho do chunk condiciona tanto a precisão quanto a fatura. Chunks menores trazem menos contexto, mas exigem recuperar mais resultados.
- Chunks menores reduzem o custo de contexto por consulta.
- Top-k maior compensa a perda de contexto, mas soma tokens.
- O reranker melhora a precisão em troca de uma taxa por consulta.
Comparar provedores e prever o gasto
Os preços de embeddings variam muito entre provedores para qualidade semelhante. Compare custo e qualidade antes de fixar seu pipeline.
- Estime seu corpus, número de documentos e volume de consultas.
- Escolha o modelo de embedding por custo e dimensões.
- Defina tamanho de chunk e top-k conforme seus testes de qualidade.
- Projete o gasto mensal incluindo reindexação e armazenamento.
Perguntas frequentes
Ela estima o custo total de rodar um pipeline de geração aumentada por recuperação - incluindo embedding da base de conhecimento, reindexação periódica, embedding por consulta, reranking, geração do LLM e armazenamento vetorial. Diferente de uma simples ferramenta de custo por token, ela cobre todas as camadas de cobrança de um sistema RAG em produção.
Pipelines RAG têm quatro camadas principais de custo: (1) embedding de ingestão - embeber todos os documentos uma vez e re-embeder periodicamente; (2) embedding de consulta - embeber cada consulta do usuário antes da busca vetorial; (3) geração do LLM - o custo dominante, enviando os trechos recuperados como contexto; e (4) taxas opcionais de armazenamento no banco vetorial conforme o tamanho do índice.
Chunks menores (200-400 tokens) reduzem o custo de contexto do LLM por consulta, pois cada trecho recuperado contribui com menos tokens de entrada. Porém, podem exigir top-k maior para capturar contexto suficiente. Use esta calculadora para simular diferentes tamanhos de chunk e valores de top-k e encontrar a configuração de custo ideal.
O custo de reindexação é a despesa de re-embeder toda a sua base de conhecimento na frequência indicada. Por exemplo, se você reindexa a cada 30 dias e o custo total de ingestão é US$ 5,00, o custo mensal de reindexação é US$ 5,00. A calculadora divide seu período de previsão pelo intervalo de reindexação para determinar o número de ciclos completos de re-embedding.
O custo de armazenamento vetorial é calculado como (número de documentos × bytes por vetor) + overhead de metadados, convertido em GB e multiplicado pela tarifa mensal por GB. Os bytes por vetor dependem das dimensões do modelo de embedding (por exemplo, text-embedding-3-small: 1536 dim × 4 bytes = 6.144 bytes). A calculadora inclui 40 bytes de metadados por vetor.
A calculadora suporta OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) e Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Todas as tarifas refletem preços padrão de pague pelo uso.
Sim. A calculadora processa todos os cálculos inteiramente no seu navegador. Contagens de documentos, volumes de consultas e estimativas de custo são calculados localmente no seu dispositivo e nunca transmitidos a servidor algum. Nenhum dado sai do navegador e não é preciso cadastro.