Pular para o conteúdo
Aback Tools Logo

Calculadora de custos de RAG

Estime grátis e online o custo completo de um pipeline de geração aumentada por recuperação. Calcule ingestão de embeddings, reindexação, recuperação por consulta, geração do LLM, taxas opcionais de reranker e armazenamento em banco de dados vetorial na OpenAI, Anthropic, Google, Cohere, Voyage e mais. Totalmente privado, roda no seu navegador.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

As quatro camadas de custo de um pipeline RAG

Um sistema RAG não é cobrado como uma única chamada. Há ingestão, consulta, geração e armazenamento, e cada camada tem seu preço.

A geração do LLM costuma dominar, pois envia os trechos recuperados como contexto em cada resposta.

  • Ingestão: embeber o corpus completo uma vez e reindexar periodicamente.
  • Consulta: embeber cada pergunta antes da busca vetorial.
  • Geração: enviar o contexto recuperado e produzir a resposta.
  • Armazenamento: pagar pelo índice vetorial conforme seu tamanho.

Chunks, top-k e reranking

O tamanho do chunk condiciona tanto a precisão quanto a fatura. Chunks menores trazem menos contexto, mas exigem recuperar mais resultados.

  • Chunks menores reduzem o custo de contexto por consulta.
  • Top-k maior compensa a perda de contexto, mas soma tokens.
  • O reranker melhora a precisão em troca de uma taxa por consulta.

Comparar provedores e prever o gasto

Os preços de embeddings variam muito entre provedores para qualidade semelhante. Compare custo e qualidade antes de fixar seu pipeline.

  1. Estime seu corpus, número de documentos e volume de consultas.
  2. Escolha o modelo de embedding por custo e dimensões.
  3. Defina tamanho de chunk e top-k conforme seus testes de qualidade.
  4. Projete o gasto mensal incluindo reindexação e armazenamento.

Perguntas frequentes

Ela estima o custo total de rodar um pipeline de geração aumentada por recuperação - incluindo embedding da base de conhecimento, reindexação periódica, embedding por consulta, reranking, geração do LLM e armazenamento vetorial. Diferente de uma simples ferramenta de custo por token, ela cobre todas as camadas de cobrança de um sistema RAG em produção.

Pipelines RAG têm quatro camadas principais de custo: (1) embedding de ingestão - embeber todos os documentos uma vez e re-embeder periodicamente; (2) embedding de consulta - embeber cada consulta do usuário antes da busca vetorial; (3) geração do LLM - o custo dominante, enviando os trechos recuperados como contexto; e (4) taxas opcionais de armazenamento no banco vetorial conforme o tamanho do índice.

Chunks menores (200-400 tokens) reduzem o custo de contexto do LLM por consulta, pois cada trecho recuperado contribui com menos tokens de entrada. Porém, podem exigir top-k maior para capturar contexto suficiente. Use esta calculadora para simular diferentes tamanhos de chunk e valores de top-k e encontrar a configuração de custo ideal.

O custo de reindexação é a despesa de re-embeder toda a sua base de conhecimento na frequência indicada. Por exemplo, se você reindexa a cada 30 dias e o custo total de ingestão é US$ 5,00, o custo mensal de reindexação é US$ 5,00. A calculadora divide seu período de previsão pelo intervalo de reindexação para determinar o número de ciclos completos de re-embedding.

O custo de armazenamento vetorial é calculado como (número de documentos × bytes por vetor) + overhead de metadados, convertido em GB e multiplicado pela tarifa mensal por GB. Os bytes por vetor dependem das dimensões do modelo de embedding (por exemplo, text-embedding-3-small: 1536 dim × 4 bytes = 6.144 bytes). A calculadora inclui 40 bytes de metadados por vetor.

A calculadora suporta OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) e Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Todas as tarifas refletem preços padrão de pague pelo uso.

Sim. A calculadora processa todos os cálculos inteiramente no seu navegador. Contagens de documentos, volumes de consultas e estimativas de custo são calculados localmente no seu dispositivo e nunca transmitidos a servidor algum. Nenhum dado sai do navegador e não é preciso cadastro.