Calculadora de costes de RAG
Estima gratis y online el coste completo de un pipeline de generación aumentada por recuperación. Calcula la ingesta de embeddings, el reindexado, la recuperación por consulta, la generación del LLM, las tarifas opcionales del reranker y el almacenamiento de la base de datos vectorial en OpenAI, Anthropic, Google, Cohere, Voyage y más. Totalmente privado, funciona en tu navegador.
Estimate the full cost of a Retrieval-Augmented Generation pipeline - from knowledge base ingestion and re-embedding schedules to per-query embedding, optional reranker, LLM completion, and vector database storage. All calculations run locally in your browser.
Knowledge Base (Ingestion)
Query Pipeline (per request)
LLM Context per Request
Total Monthly RAG Pipeline Cost
Cost / Query
$0.000602
Query LLM Cost
$18.00
Embedding Cost
$0.1600
Storage Cost
$0.00
Monthly Cost Breakdown
Initial one-time cost: $0.1000
Initial Ingestion
$0.1000
one-time cost
Cost per Query
$0.000602
all pipeline steps
Knowledge Base Size
59.0 MB
10,000 vectors
LLM Generation Cost Comparison
Same context, all models| Model | Cost/Query | Monthly LLM Cost |
|---|---|---|
Mistral Small(Mistral)Budget | $0.000350 | $10.50 |
GPT-4o mini(OpenAI)Budget Active | $0.000600 | $18.00 |
Command R(Cohere)Budget | $0.000600 | $18.00 |
DeepSeek-V3(DeepSeek)Budget | $0.001090 | $32.70 |
Gemini 2.5 Flash(Google)Budget | $0.001850 | $55.50 |
Claude 3.5 Haiku(Anthropic)Budget | $0.003600 | $108.00 |
o4-mini(OpenAI) | $0.004400 | $132.00 |
Mistral Large(Mistral) | $0.007000 | $210.00 |
Gemini 2.5 Pro(Google) | $0.007500 | $225.00 |
GPT-4o(OpenAI) | $0.0100 | $300.00 |
Command R+(Cohere) | $0.0100 | $300.00 |
Claude 3.7 Sonnet(Anthropic)Capable | $0.0135 | $405.00 |
Click any row to select that LLM.
Las cuatro capas de coste de un pipeline RAG
Un sistema RAG no se factura como una sola llamada. Hay ingesta, consulta, generación y almacenamiento, y cada capa tiene su propio precio.
La generación del LLM suele ser la partida dominante porque envía fragmentos recuperados como contexto en cada respuesta.
- Ingesta: embeber el corpus completo una vez y reindexar periódicamente.
- Consulta: embeber cada pregunta antes de la búsqueda vectorial.
- Generación: enviar el contexto recuperado y producir la respuesta.
- Almacenamiento: pagar por el índice vectorial según su tamaño.
Fragmentos, top-k y reranking
El tamaño de fragmento condiciona tanto la precisión como la factura. Fragmentos pequeños aportan menos tokens de contexto, pero necesitan recuperar más resultados.
- Fragmentos menores reducen el coste de contexto por consulta.
- Top-k más alto compensa la pérdida de contexto, pero añade tokens.
- El reranker mejora la precisión a cambio de una tarifa por consulta.
Comparar proveedores y prever el gasto
Los precios de embeddings varían mucho entre proveedores para una calidad similar. Compara la relación coste-calidad antes de fijar tu pipeline.
- Estima tu corpus, tu número de documentos y tu volumen de consultas.
- Elige el modelo de embeddings por coste y dimensiones.
- Define tamaño de fragmento y top-k según tus pruebas de calidad.
- Proyecta el gasto mensual incluyendo reindexado y almacenamiento.
Preguntas frecuentes
Estima el coste total de ejecutar un pipeline de generación aumentada por recuperación: embedding de la base de conocimiento, reindexado periódico, embedding por consulta, reranking, generación del LLM y almacenamiento vectorial. A diferencia de una simple herramienta de coste por tokens, esta calculadora cubre todas las capas de facturación de un sistema RAG en producción.
Los pipelines RAG tienen cuatro capas principales de coste: (1) embedding de ingesta, embeber todos los documentos una vez y volver a embeberlos según un calendario; (2) embedding de consulta, embeber cada consulta del usuario antes de la búsqueda vectorial; (3) generación del LLM, el coste dominante, enviando los fragmentos recuperados como contexto y generando una respuesta; y (4) tarifas opcionales de almacenamiento en la base de datos vectorial según el tamaño del índice.
Los fragmentos más pequeños (200-400 tokens) reducen el coste de contexto del LLM por consulta, ya que cada fragmento recuperado aporta menos tokens de entrada. Sin embargo, pueden exigir un top-k mayor para capturar suficiente contexto. Usa esta calculadora para simular distintos tamaños de fragmento y valores de top-k y encontrar la configuración de coste óptima.
El coste de reindexado es el gasto de volver a embeber toda tu base de conocimiento con la frecuencia indicada. Por ejemplo, si reindexas cada 30 días y el coste total de ingesta es 5,00 $, el coste mensual de reindexado es 5,00 $. La calculadora divide tu periodo de previsión entre el intervalo de reindexado para determinar el número de ciclos completos de re-embedding.
El coste de almacenamiento vectorial se calcula como (número de documentos × bytes por vector) + sobrecarga de metadatos, convertido a GB y multiplicado por la tarifa mensual por GB. Los bytes por vector dependen de las dimensiones del modelo de embeddings (por ejemplo, text-embedding-3-small: 1536 dim × 4 bytes = 6144 bytes). La calculadora incluye 40 bytes de metadatos por vector.
La calculadora admite OpenAI (text-embedding-3-small, text-embedding-3-large, ada-002), Cohere (embed-english-v3, embed-multilingual-v3), Google (text-embedding-004) y Voyage AI (voyage-3-lite, voyage-3, voyage-3-large). Todas las tarifas reflejan precios estándar de pago por uso.
Sí. La calculadora procesa todos los cálculos íntegramente en tu navegador. El número de documentos, los volúmenes de consultas y las estimaciones de coste se calculan localmente en tu dispositivo y nunca se transmiten a ningún servidor. Ningún dato sale de tu navegador y no se requiere registro.