Calculadora de empaquetado de contexto
Optimiza cuántos fragmentos RAG caben en la ventana de contexto de cualquier modelo, gratis y online. Configura tamaño de fragmento, solapamiento, prompt de sistema, reserva de salida y margen de seguridad para GPT, Claude, Gemini, DeepSeek, Llama y Mistral. Consulta al instante un desglose completo de tokens, la barra de contexto y la comparación entre modelos.
Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.
Fixed Context Overhead
Chunk Configuration
Safety Buffer & Volume
Max Chunks That Fit
326
of 400-token chunks
Tokens for Chunks
114.2K
of 128.0K ctx window
Unused Tokens
0
headroom remaining
Context Window Breakdown - GPT-4o
| Slot | Tokens | % of Window | Notes |
|---|---|---|---|
| System Prompt | 400 | 0% | Fixed overhead |
| User Query | 150 | 0% | Fixed overhead |
| Retrieved Chunks | 114,150 | 89% | 326 × 400 tok |
| Output Reserve | 500 | 0% | Max response |
| Safety Buffer | 12,800 | 10% | 10% headroom |
| Unused / Slack | 0 | 0% | Free headroom |
Monthly RAG Query Cost - 30,000 requests
Per Query (Input)
$0.2880
Per Query (Output)
$0.005000
Total Per Query
$0.2930
Chunks That Fit - All Models
Sorted by most chunks first| Model | Context | Max Chunks | Monthly Cost | Min Met? |
|---|---|---|---|---|
GoogleGemini 2.5 ProCapable | 2.0M | 5,139 | $67,640.62 | Yes |
OpenAIGPT-5.4Capable | 1.0M | 2,568 | $67,792.50 | Yes |
GoogleGemini 2.5 FlashBudget | 1.0M | 2,568 | $8,136.60 | Yes |
GoogleGemini 3.5 FlashBudget | 1.0M | 2,568 | $40,630.50 | Yes |
DeepSeekDeepSeek V4 ProBudget | 1.0M | 2,568 | $11,756.75 | Yes |
DeepSeekDeepSeek V4 FlashBudget | 1.0M | 2,568 | $3,783.78 | Yes |
MetaLlama 4 MaverickBudget | 524.0K | 1,344 | $3,125.10 | Yes |
OpenAIo3 (Reasoning) | 200.0K | 511 | $10,917.00 | Yes |
AnthropicClaude Sonnet 4.6Capable | 200.0K | 511 | $16,420.50 | Yes |
AnthropicClaude Haiku 4.5Budget | 200.0K | 511 | $5,473.50 | Yes |
AnthropicClaude Opus 4.8Capable | 200.0K | 511 | $27,367.50 | Yes |
MistralMistral Large | 131.1K | 333 | $7,149.00 | Yes |
MistralMistral SmallBudget | 131.1K | 333 | $357.45 | Yes |
OpenAIGPT-4o Selected | 128.0K | 326 | $8,790.00 | Yes |
OpenAIGPT-4o MiniBudget | 128.0K | 326 | $527.40 | Yes |
Qué se lleva el presupuesto de tokens de una consulta
La ventana de contexto no está disponible solo para los fragmentos recuperados. El prompt de sistema, la consulta del usuario, el formato de los mensajes y la respuesta esperada consumen presupuesto antes de que entre un solo documento.
Introduce el tamaño de la ventana, los tokens fijos y el tamaño de fragmento para ver cuántos fragmentos caben realmente y cuánto contexto queda sin usar.
- Contexto efectivo = ventana de contexto × (1 − margen de seguridad).
- Disponible = contexto efectivo − prompt de sistema − consulta − reserva de salida.
- Máximo de fragmentos = 1 + floor((disponible − tamaño) / (tamaño − solapamiento)).
Equilibrar fragmentos y estructura
Un fragmento más pequeño cabe más veces, pero cada uno aporta menos contexto. Un fragmento más grande aporta más contexto por unidad, pero reduce el número de documentos distintos que puedes incluir.
- Recuperar de 3 a 8 fragmentos por consulta es lo habitual en producción.
- Un solapamiento del 10-15 % preserva la continuidad entre límites.
- Reservar pocos tokens de salida es la causa más común de truncamiento en producción.
Ajustar el sistema paso a paso
Empieza por el modelo y la ventana de contexto, luego ajusta el tamaño de fragmento hasta que quepan suficientes documentos relevantes con una reserva de salida cómoda.
- Selecciona el modelo y fija el margen de seguridad para obtener el contexto efectivo.
- Resta los tokens del prompt de sistema, la consulta y la reserva de salida.
- Ajusta el tamaño de fragmento y el solapamiento hasta alcanzar el número de fragmentos que necesitas.
- Comprueba el desglose de tokens y compara con otro modelo antes de implementar.
Preguntas frecuentes
Determina cuántos fragmentos de documento recuperados caben en la ventana de contexto de un modelo de lenguaje para una sola consulta RAG. Tiene en cuenta el coste fijo como el prompt de sistema, la consulta del usuario y la reserva de salida, y luego calcula el número máximo de fragmentos con la fórmula de ventana deslizante.
La fórmula es: max_fragmentos = 1 + floor((tokens_disponibles − tamaño_fragmento) / (tamaño_fragmento − solapamiento)). Donde tokens_disponibles = contexto_efectivo − tokens_prompt_sistema − tokens_consulta − tokens_reserva_salida, y contexto_efectivo = ventana_contexto × (1 − margen_seguridad).
La mayoría de los sistemas RAG en producción usan tamaños de fragmento entre 256 y 512 tokens. Los fragmentos más pequeños mejoran la precisión de recuperación, pero necesitan más fragmentos para cubrir un tema. Un tamaño de 400 tokens con un 10 % de solapamiento es un punto de partida habitual para RAG de propósito general.
El solapamiento significa que fragmentos adyacentes comparten algunos tokens en sus límites. Esto preserva la continuidad de frases y párrafos: la información dividida entre límites está disponible en ambos fragmentos, lo que mejora la exhaustividad de la recuperación. Un solapamiento típico es del 10-15 % del tamaño del fragmento.
Los LLM usan la misma ventana de contexto para entrada y salida. Si llenas todo el contexto con tokens de prompt, el modelo no tiene espacio para generar respuesta. Reserva siempre al menos 256-512 tokens para respuestas cortas, o más para salidas largas y estructuradas.
Un margen de seguridad reserva un porcentaje de la ventana de contexto como holgura para la variación de tokenización. Los recuentos reales de tokens pueden diferir de las estimaciones en unos pocos puntos porcentuales por los tokens de formato de mensaje y las diferencias entre tokenizadores de cada modelo. Un margen del 5-10 % evita errores de desbordamiento en producción.
La mayoría de los sistemas RAG recuperan de 3 a 8 fragmentos por consulta. Menos de 3 puede no aportar contexto suficientemente diverso. Más de 8 puede diluir la relevancia. El número óptimo depende de tu caso de uso: las preguntas y respuestas factuales suelen necesitar 3-5 fragmentos, mientras que la síntesis de documentos puede beneficiarse de 8-12.
Completamente. La calculadora funciona íntegramente en tu navegador. El tamaño de fragmento, los recuentos de tokens, la configuración del modelo y las estimaciones de coste se procesan localmente: nada se envía a ningún servidor. La configuración de tu pipeline RAG permanece 100 % privada.