Saltar al contenido
Aback Tools Logo

Calculadora de empaquetado de contexto

Optimiza cuántos fragmentos RAG caben en la ventana de contexto de cualquier modelo, gratis y online. Configura tamaño de fragmento, solapamiento, prompt de sistema, reserva de salida y margen de seguridad para GPT, Claude, Gemini, DeepSeek, Llama y Mistral. Consulta al instante un desglose completo de tokens, la barra de contexto y la comparación entre modelos.

Context Packing Calculator

Optimize how many RAG chunks fit into any model's context window. Configure your system prompt, query, output reserve, chunk size, and overlap - then instantly see the maximum chunk count, token breakdown, API cost per query, and cross-model comparisons.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Fixed Context Overhead

tokens
tokens
tokens
Fixed overhead: 1,050 tokens (1% of context)

Chunk Configuration

tokens
tokens
chunks

Safety Buffer & Volume

%
reqs

Max Chunks That Fit

326

of 400-token chunks

Tokens for Chunks

114.2K

of 128.0K ctx window

Unused Tokens

0

headroom remaining

Context Window Breakdown - GPT-4o

System (400)Query (150)Chunks (114.2K)Output (500)Buffer (12.8K)Unused (0)
Used: 115.2K (90%)Effective: 115.2KLimit: 128.0K
SlotTokens% of WindowNotes
System Prompt4000%Fixed overhead
User Query1500%Fixed overhead
Retrieved Chunks114,15089%326 × 400 tok
Output Reserve5000%Max response
Safety Buffer12,80010%10% headroom
Unused / Slack00%Free headroom

Monthly RAG Query Cost - 30,000 requests

$8,790.00GPT-4o

Per Query (Input)

$0.2880

Per Query (Output)

$0.005000

Total Per Query

$0.2930

Chunks That Fit - All Models

Sorted by most chunks first
ModelContextMax ChunksMonthly CostMin Met?
GoogleGemini 2.5 ProCapable
2.0M5,139$67,640.62 Yes
OpenAIGPT-5.4Capable
1.0M2,568$67,792.50 Yes
GoogleGemini 2.5 FlashBudget
1.0M2,568$8,136.60 Yes
GoogleGemini 3.5 FlashBudget
1.0M2,568$40,630.50 Yes
DeepSeekDeepSeek V4 ProBudget
1.0M2,568$11,756.75 Yes
DeepSeekDeepSeek V4 FlashBudget
1.0M2,568$3,783.78 Yes
MetaLlama 4 MaverickBudget
524.0K1,344$3,125.10 Yes
OpenAIo3 (Reasoning)
200.0K511$10,917.00 Yes
AnthropicClaude Sonnet 4.6Capable
200.0K511$16,420.50 Yes
AnthropicClaude Haiku 4.5Budget
200.0K511$5,473.50 Yes
AnthropicClaude Opus 4.8Capable
200.0K511$27,367.50 Yes
MistralMistral Large
131.1K333$7,149.00 Yes
MistralMistral SmallBudget
131.1K333$357.45 Yes
OpenAIGPT-4o Selected
128.0K326$8,790.00 Yes
OpenAIGPT-4o MiniBudget
128.0K326$527.40 Yes
Packing Formula: Chunk capacity = 1 + floor((available_tokens − chunk_size) / (chunk_size − overlap)). Available tokens = effective context − system prompt − query − output reserve. Effective context = context window × (1 − safety buffer%). Actual results may vary slightly due to tokenizer overhead on special tokens and message format wrappers.

Qué se lleva el presupuesto de tokens de una consulta

La ventana de contexto no está disponible solo para los fragmentos recuperados. El prompt de sistema, la consulta del usuario, el formato de los mensajes y la respuesta esperada consumen presupuesto antes de que entre un solo documento.

Introduce el tamaño de la ventana, los tokens fijos y el tamaño de fragmento para ver cuántos fragmentos caben realmente y cuánto contexto queda sin usar.

  • Contexto efectivo = ventana de contexto × (1 − margen de seguridad).
  • Disponible = contexto efectivo − prompt de sistema − consulta − reserva de salida.
  • Máximo de fragmentos = 1 + floor((disponible − tamaño) / (tamaño − solapamiento)).

Equilibrar fragmentos y estructura

Un fragmento más pequeño cabe más veces, pero cada uno aporta menos contexto. Un fragmento más grande aporta más contexto por unidad, pero reduce el número de documentos distintos que puedes incluir.

  • Recuperar de 3 a 8 fragmentos por consulta es lo habitual en producción.
  • Un solapamiento del 10-15 % preserva la continuidad entre límites.
  • Reservar pocos tokens de salida es la causa más común de truncamiento en producción.

Ajustar el sistema paso a paso

Empieza por el modelo y la ventana de contexto, luego ajusta el tamaño de fragmento hasta que quepan suficientes documentos relevantes con una reserva de salida cómoda.

  1. Selecciona el modelo y fija el margen de seguridad para obtener el contexto efectivo.
  2. Resta los tokens del prompt de sistema, la consulta y la reserva de salida.
  3. Ajusta el tamaño de fragmento y el solapamiento hasta alcanzar el número de fragmentos que necesitas.
  4. Comprueba el desglose de tokens y compara con otro modelo antes de implementar.

Preguntas frecuentes

Determina cuántos fragmentos de documento recuperados caben en la ventana de contexto de un modelo de lenguaje para una sola consulta RAG. Tiene en cuenta el coste fijo como el prompt de sistema, la consulta del usuario y la reserva de salida, y luego calcula el número máximo de fragmentos con la fórmula de ventana deslizante.

La fórmula es: max_fragmentos = 1 + floor((tokens_disponibles − tamaño_fragmento) / (tamaño_fragmento − solapamiento)). Donde tokens_disponibles = contexto_efectivo − tokens_prompt_sistema − tokens_consulta − tokens_reserva_salida, y contexto_efectivo = ventana_contexto × (1 − margen_seguridad).

La mayoría de los sistemas RAG en producción usan tamaños de fragmento entre 256 y 512 tokens. Los fragmentos más pequeños mejoran la precisión de recuperación, pero necesitan más fragmentos para cubrir un tema. Un tamaño de 400 tokens con un 10 % de solapamiento es un punto de partida habitual para RAG de propósito general.

El solapamiento significa que fragmentos adyacentes comparten algunos tokens en sus límites. Esto preserva la continuidad de frases y párrafos: la información dividida entre límites está disponible en ambos fragmentos, lo que mejora la exhaustividad de la recuperación. Un solapamiento típico es del 10-15 % del tamaño del fragmento.

Los LLM usan la misma ventana de contexto para entrada y salida. Si llenas todo el contexto con tokens de prompt, el modelo no tiene espacio para generar respuesta. Reserva siempre al menos 256-512 tokens para respuestas cortas, o más para salidas largas y estructuradas.

Un margen de seguridad reserva un porcentaje de la ventana de contexto como holgura para la variación de tokenización. Los recuentos reales de tokens pueden diferir de las estimaciones en unos pocos puntos porcentuales por los tokens de formato de mensaje y las diferencias entre tokenizadores de cada modelo. Un margen del 5-10 % evita errores de desbordamiento en producción.

La mayoría de los sistemas RAG recuperan de 3 a 8 fragmentos por consulta. Menos de 3 puede no aportar contexto suficientemente diverso. Más de 8 puede diluir la relevancia. El número óptimo depende de tu caso de uso: las preguntas y respuestas factuales suelen necesitar 3-5 fragmentos, mientras que la síntesis de documentos puede beneficiarse de 8-12.

Completamente. La calculadora funciona íntegramente en tu navegador. El tamaño de fragmento, los recuentos de tokens, la configuración del modelo y las estimaciones de coste se procesan localmente: nada se envía a ningún servidor. La configuración de tu pipeline RAG permanece 100 % privada.