Saltar al contenido
Aback Tools Logo

Calculadora de costes de RAG

Estima gratis y online el coste completo de un pipeline de generación aumentada por recuperación. Calcula la ingesta de embeddings, el reindexado, la recuperación por consulta, la generación del LLM, las tarifas opcionales del reranker y el almacenamiento de la base de datos vectorial en OpenAI, Anthropic, Google, Cohere, Voyage y más. Totalmente privado, funciona en tu navegador.

RAG Cost Calculator

Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.

Knowledge Base (Ingestion)

docs
tokens
days
Rate: $0.02/1M tokensDims: 1536Vector size: 6.0 KB

Query Pipeline (per request)

req/day
chunks
tokens
tokens
tokens
tokens

LLM Context per Request

System: 400Query: 100Chunks: 1,500Total in: 2,000
Input/1M: $0.15Output/1M: $0.60

Total Monthly RAG Pipeline Cost

$18.16for 30,000 queries

Cost / Query

$0.000602

Query LLM Cost

$18.00

Embedding Cost

$0.1600

Storage Cost

$0.00

Monthly Cost Breakdown

1. Knowledge Base Ingestion5,000K tokens × 1.0 re-index cycles
$0.1000

Initial one-time cost: $0.1000

2. Query Embedding100 tokens × 30,000 queries
$0.0600
3. LLM Generation (GPT-4o mini)2,000 in + 500 out tokens × 30,000 queries
$18.00

Initial Ingestion

$0.1000

one-time cost

Cost per Query

$0.000602

all pipeline steps

Knowledge Base Size

59.0 MB

10,000 vectors

LLM Generation Cost Comparison

Same context, all models
ModelCost/QueryMonthly LLM Cost
Mistral Small(Mistral)Budget
$0.000350$10.50
GPT-4o mini(OpenAI)Budget Active
$0.000600$18.00
Command R(Cohere)Budget
$0.000600$18.00
DeepSeek-V3(DeepSeek)Budget
$0.001090$32.70
Gemini 2.5 Flash(Google)Budget
$0.001850$55.50
Claude 3.5 Haiku(Anthropic)Budget
$0.003600$108.00
o4-mini(OpenAI)
$0.004400$132.00
Mistral Large(Mistral)
$0.007000$210.00
Gemini 2.5 Pro(Google)
$0.007500$225.00
GPT-4o(OpenAI)
$0.0100$300.00
Command R+(Cohere)
$0.0100$300.00
Claude 3.7 Sonnet(Anthropic)Capable
$0.0135$405.00

Click any row to select that LLM.

Disclaimer: Estimates use standard Pay-As-You-Go rates from published provider documentation. Embedding costs apply only to tokens processed; re-indexing frequency is linear. Vector DB storage estimates are based on float32 vectors plus 40 bytes metadata overhead per record. Actual costs vary with regional pricing, volume discounts, and specific provider configurations. All calculations run locally in your browser - no data is transmitted.

Las cuatro capas de coste de un pipeline RAG

Un sistema RAG no se factura como una sola llamada. Hay ingesta, consulta, generación y almacenamiento, y cada capa tiene su propio precio.

La generación del LLM suele ser la partida dominante porque envía fragmentos recuperados como contexto en cada respuesta.

  • Ingesta: embeber el corpus completo una vez y reindexar periódicamente.
  • Consulta: embeber cada pregunta antes de la búsqueda vectorial.
  • Generación: enviar el contexto recuperado y producir la respuesta.
  • Almacenamiento: pagar por el índice vectorial según su tamaño.

Fragmentos, top-k y reranking

El tamaño de fragmento condiciona tanto la precisión como la factura. Fragmentos pequeños aportan menos tokens de contexto, pero necesitan recuperar más resultados.

  • Fragmentos menores reducen el coste de contexto por consulta.
  • Top-k más alto compensa la pérdida de contexto, pero añade tokens.
  • El reranker mejora la precisión a cambio de una tarifa por consulta.

Comparar proveedores y prever el gasto

Los precios de embeddings varían mucho entre proveedores para una calidad similar. Compara la relación coste-calidad antes de fijar tu pipeline.

  1. Estima tu corpus, tu número de documentos y tu volumen de consultas.
  2. Elige el modelo de embeddings por coste y dimensiones.
  3. Define tamaño de fragmento y top-k según tus pruebas de calidad.
  4. Proyecta el gasto mensual incluyendo reindexado y almacenamiento.

Preguntas frecuentes

Estima el coste total de ejecutar un pipeline de generación aumentada por recuperación: embedding de la base de conocimiento, reindexado periódico, embedding por consulta, reranking, generación del LLM y almacenamiento vectorial. A diferencia de una simple herramienta de coste por tokens, esta calculadora cubre todas las capas de facturación de un sistema RAG en producción.

Los pipelines RAG tienen cuatro capas principales de coste: (1) embedding de ingesta, embeber todos los documentos una vez y volver a embeberlos según un calendario; (2) embedding de consulta, embeber cada consulta del usuario antes de la búsqueda vectorial; (3) generación del LLM, el coste dominante, enviando los fragmentos recuperados como contexto y generando una respuesta; y (4) tarifas opcionales de almacenamiento en la base de datos vectorial según el tamaño del índice.

Los fragmentos más pequeños (200-400 tokens) reducen el coste de contexto del LLM por consulta, ya que cada fragmento recuperado aporta menos tokens de entrada. Sin embargo, pueden exigir un top-k mayor para capturar suficiente contexto. Usa esta calculadora para simular distintos tamaños de fragmento y valores de top-k y encontrar la configuración de coste óptima.

El coste de reindexado es el gasto de volver a embeber toda tu base de conocimiento con la frecuencia indicada. Por ejemplo, si reindexas cada 30 días y el coste total de ingesta es 5,00 $, el coste mensual de reindexado es 5,00 $. La calculadora divide tu periodo de previsión entre el intervalo de reindexado para determinar el número de ciclos completos de re-embedding.

El coste de almacenamiento vectorial se calcula como (número de documentos × bytes por vector) + sobrecarga de metadatos, convertido a GB y multiplicado por la tarifa mensual por GB. Los bytes por vector dependen de las dimensiones del modelo de embeddings (por ejemplo, text-embedding-3-small: 1536 dim × 4 bytes = 6144 bytes). La calculadora incluye 40 bytes de metadatos por vector.

La calculadora admite OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) y Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Todas las tarifas reflejan precios estándar de pago por uso.

Sí. La calculadora procesa todos los cálculos íntegramente en tu navegador. El número de documentos, los volúmenes de consultas y las estimaciones de coste se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor. Ningún dato sale de tu navegador y no se requiere registro.