Saltar al contenido
Aback Tools Logo

Calculadora de uso de contexto

Analiza cuánto de la ventana de contexto de un modelo consumen tus datos de entrada: online, gratis y 100 % privado. Divide tu prompt en segmentos con nombre (prompt de sistema, historial, documentos, mensaje del usuario), fija una reserva de salida y obtén al instante desgloses porcentuales por segmento en GPT-4o, Claude, Gemini, Mistral, DeepSeek y más.

Context Usage Calculator

Break your prompt into named components - system prompt, conversation history, retrieved documents, user message - and instantly see how much of the selected model's context window each part consumes. Supports all major LLMs with live percentage breakdowns.

Context: 128,000 tokens~3.8 chars/tokenInput/1M: $2.50
~500 tok(0.4%)
~3,000 tok(2.3%)
~8,000 tok(6.3%)
~200 tok(0.2%)

Reserve space for the model's reply. Most responses use 500-4,000 tokens. Instruction tasks average ~1,000; code generation averages ~2,000.

Context Window Breakdown - GPT-4o

13,700 used (11%)128,000 total
Overall context fill10.7% used

Segment Breakdown

SegmentTokens% of Context% of InputInput Cost
System Prompt
~5000%4%$0.001250
Conversation History
~3,0002%26%$0.007500
Retrieved Documents
~8,0006%68%$0.0200
User Message
~2000%2%$0.000500
Output Reserve
~2,0002%--
Total~13,70010.7%-$0.0293

Input Tokens

~11,700

Context Remaining

114,300

Context Used

10.7%

Input Cost

$0.0293

Estimation note:Token counts are calculated using each model family's average characters-per-token ratio (~3.8-4.0 for English prose). Actual counts from provider tokenizers (tiktoken, SentencePiece, etc.) may vary by ±5-10%. Code, non-English text, and special characters typically tokenize differently. For exact counts use the provider's official tokenizer.

Qué esconde el llenado de contexto

Saber que un prompt ocupa el 70 % de la ventana no dice nada sobre qué parte aporta valor. Desglosar por segmento revela si el historial de conversación está desplazando a los documentos recuperados o si el prompt de sistema se ha vuelto desproporcionado.

Añade un segmento por cada componente de tu prompt y asigna sus tokens para ver el porcentaje de cada uno y la capacidad restante real.

  • Separa siempre prompt de sistema, historial, documentos y mensaje del usuario.
  • Cada token de contexto consume coste de API en cada petición, no solo una vez.
  • Reservar tokens de salida evita errores por prompt demasiado largo.

El efecto «perdido en el medio»

Los modelos largos no tratan toda la ventana por igual. La información situada en el centro tiende a pesar menos en la respuesta, incluso cuando el modelo la tiene disponible.

  • Coloca las instrucciones críticas al principio y al final del prompt.
  • Mantén el llenado por debajo del 80 % cuando la recuperación sea importante.
  • Reduce el historial de conversación antes de recortar los documentos recuperados.

Ajustar el prompt con datos

Medir por segmento convierte el ajuste del prompt en una decisión informada, en lugar de recortar a ciegas cuando aparece un error de contexto.

  1. Pega o estima el tamaño de cada segmento de tu prompt.
  2. Comprueba el porcentaje que ocupa cada uno y localiza el mayor consumidor.
  3. Ajusta el segmento dominante y observa de nuevo el llenado total.
  4. Repite con otros modelos para ver cuánta holgura ganas o pierdes.

Preguntas frecuentes

Es una herramienta que muestra cuánto de la ventana de contexto de un modelo de lenguaje consumen tus datos de entrada, desglosado por segmento. Defines los componentes de tu prompt (instrucciones de sistema, historial de conversación, documentos recuperados, mensaje del usuario) y la calculadora muestra el recuento de tokens de cada uno, su porcentaje sobre la ventana de contexto total y su contribución al coste de API. Ayuda a diseñar prompts que encajen de forma fiable en los límites del modelo.

La ventana de contexto es el número máximo de tokens que un LLM puede procesar en una sola petición, incluido todo el prompt, el historial de conversación, los documentos y la respuesta generada. Si tu entrada supera la ventana, el modelo truncará la entrada o rechazará la petición con un error. Vigilar el uso del contexto es esencial en chatbots multiturno, pipelines RAG y cualquier aplicación que envíe documentos grandes a un modelo.

Las estimaciones son precisas en un margen de ±5-10 % para prosa inglesa típica, usando el ratio medio de caracteres por token publicado de cada familia de modelos. El texto en otros idiomas, el código con símbolos densos y el contenido con mucha puntuación pueden tokenizarse de forma distinta. Para recuentos exactos en producción usa el tokenizador oficial del proveedor (por ejemplo tiktoken de OpenAI, countTokens de Anthropic o la API countTokens de Google).

Sí. Cada fila de segmento tiene un selector de unidad que permite alternar entre tokens, caracteres y palabras. La calculadora convierte caracteres y palabras a un recuento estimado de tokens automáticamente usando el ratio de tokenización del modelo seleccionado. Es útil cuando conoces el número de caracteres de un documento o de palabras de un pasaje pero no lo has pasado por un tokenizador.

Resta un número fijo de tokens del contexto disponible para tener en cuenta la respuesta del modelo. Como la ventana de contexto debe alojar tanto el prompt de entrada como la salida generada, es importante dejar suficiente holgura. Las reservas típicas son de 500-1.000 tokens para respuestas cortas, 2.000 para generación de código y 4.000 o más para informes largos o explicaciones detalladas.

La investigación y la experiencia práctica muestran que los modelos con contextos muy largos tienden a restar peso a la información situada en medio de la ventana, un fenómeno conocido como «lost in the middle» (perdido en el medio). Para un mejor rendimiento de recuperación, mantén las instrucciones críticas en las primeras y últimas partes del prompt y procura no superar el 80 % de llenado.

Sí. La calculadora funciona íntegramente en el lado del cliente, en tu navegador. El texto del prompt, los tamaños de los segmentos y el análisis de uso se calculan localmente en tu dispositivo y nunca se envían a ningún servidor. Puedes pegar con seguridad documentos confidenciales, código propietario e instrucciones sensibles sin preocupaciones de privacidad.