Saltar al contenido
Aback Tools Logo

Calculadora de ventana de contexto

Visualiza cómo tu prompt de sistema, el historial de conversación, los documentos RAG y el mensaje del usuario llenan la ventana de contexto de un LLM. Añade bloques personalizados, consulta la utilización y la capacidad restante, compara tu carga útil en 16 modelos populares y estima los costes de entrada — todo gratis y 100 % privado en tu navegador.

Context Window Calculator

Select a model and add your prompt components below to visualize how your context window is distributed. See utilization, remaining capacity, and estimated API cost - instantly and privately in your browser.

Context: 128,000 tokensInput/1M: $2.50Output/1M: $10.00

Context Slots

System Prompt
0.4%
Conversation History
1.6%
Retrieved Documents (RAG)
3.1%
User Message
0.4%
Output Reserve
0.8%

Add Slot

Context Window Utilization - GPT-4o

6.3% used
System Prompt500
Conversation History2,000
Retrieved Documents (RAG)4,000
User Message500
Output Reserve1,000
Free120,000

Used

8,000

Limit

128,000

Remaining

120,000

Input Cost

$0.0200

Slot Breakdown

SlotTokens% of WindowInput Cost
System Prompt
5000.39%$0.001250
Conversation History
2,0001.56%$0.005000
Retrieved Documents (RAG)
4,0003.13%$0.0100
User Message
5000.39%$0.001250
Output Reserve
1,0000.78%$0.002500
Total8,0006.25%$0.0200

Same Payload Across Models

ModelContext Window% UsedFits?
GPT-4oSelected128,0006.3% Yes
GPT-4o mini128,0006.3% Yes
o3200,0004.0% Yes
o4-mini200,0004.0% Yes
Claude 3.7 Sonnet200,0004.0% Yes
Claude 3.5 Haiku200,0004.0% Yes
Claude Opus 4200,0004.0% Yes
Gemini 2.5 Pro2,000,0000.4% Yes
Gemini 2.5 Flash1,000,0000.8% Yes
DeepSeek-V4-Flash1,048,5760.8% Yes
DeepSeek-V4-Pro1,048,5760.8% Yes
Grok 3131,0726.1% Yes
Grok 3 Mini131,0726.1% Yes
Mistral Large131,0726.1% Yes
Mistral Small131,0726.1% Yes
Codestral256,0003.1% Yes
Note: Token counts entered here are the billable input tokens for each slot. Actual tokenization may vary slightly by model and content type (code vs. prose vs. non-English text). Context window limits shown are the maximum prompt+response window; reserve tokens for your expected output length.

Qué ocupa realmente tu ventana de contexto

En aplicaciones reales, el prompt de sistema y el historial de conversación suelen consumir más contexto que los documentos que realmente aportan la respuesta. Visualizarlo en bloques hace visible ese desequilibrio.

Añade un bloque por componente, introduce sus tokens y observa la utilización total, la capacidad restante y si tu carga útil cabe en cada modelo.

  • La ventana se comparte entre entrada y salida: el prompt nunca puede ocuparla entera.
  • El historial de conversación crece con cada turno y desplaza a los documentos útiles.
  • El desbordamiento se señala en rojo antes de que llegue a la API.

Presupuestar tokens para la respuesta

El error más frecuente es calcular el prompt hasta el último token y olvidar la respuesta. La reserva de salida forma parte del mismo presupuesto.

  • Reserva 1.000-4.000 tokens para respuestas estándar.
  • Para generación de código o informes largos, reserva más y recorta el prompt.
  • Si la reserva no cabe, reduce historial o número de documentos, no la instrucción crítica.

Comparar modelos antes de decidir

La misma carga útil puede caber con holgura en un modelo y desbordar en otro. Comparar varios modelos evita cambiar de proveedor después de implementar.

  1. Introduce los bloques de tu prompt con sus tokens.
  2. Fija la reserva de salida que necesita tu caso de uso.
  3. Observa la utilización resultante en cada modelo de la lista.
  4. Elige el modelo que deja la holgura necesaria al coste más bajo de entrada.

Preguntas frecuentes

Es el número máximo de tokens que un modelo de lenguaje grande puede procesar en una sola petición. Incluye todo el prompt (instrucciones de sistema, historial de conversación, documentos recuperados y el mensaje del usuario) más la respuesta generada. Si el total supera el límite, el modelo trunca o rechaza la petición.

La ventana de contexto es el presupuesto total de tokens de una petición, compartido entre entrada y salida. Los tokens máximos de salida son la longitud máxima de la respuesta generada. Por ejemplo, si un modelo tiene 128.000 tokens de contexto y tu prompt usa 120.000, solo quedan 8.000 para la respuesta. Reserva siempre espacio de salida al planificar el prompt.

Cada bloque de esta calculadora acepta directamente un número de tokens. Si no conoces el recuento exacto, una estimación fiable es 1 token por cada ~3,8-4,0 caracteres en prosa inglesa, o puedes usar nuestra herramienta de conteo de tokens para contar tokens desde texto pegado. En código, el ratio varía según el lenguaje y la densidad de símbolos.

La mayoría de las API devuelven un error (400 o 413) si tu prompt excede el límite de contexto del modelo. Algunos modelos truncan silenciosamente los turnos más antiguos de la conversación o el inicio del prompt, lo que provoca comportamientos inesperados. La calculadora resalta el desbordamiento en rojo para que lo detectes antes de hacer la llamada a la API.

La ventana de contexto es un presupuesto compartido entre tu prompt y la respuesta del modelo. Si tu prompt llena toda la ventana, el modelo no tiene tokens disponibles para generar salida. La buena práctica es reservar al menos tantos tokens como la longitud máxima esperada de la respuesta: normalmente 1.000-4.000 tokens para respuestas estándar, o más para tareas de generación larga.

A mediados de 2026, Gemini 2.5 Pro de Google ofrece la ventana de contexto más grande, con 2.000.000 de tokens. Gemini 2.5 Flash y DeepSeek-V4-Flash admiten más de 1.000.000 de tokens. Los modelos Claude de Anthropic y o3/o4-mini de OpenAI admiten 200.000 tokens. GPT-4o, Grok 3 y los modelos Mistral suelen ofrecer 128.000-131.072 tokens.

Sí. La calculadora funciona íntegramente en tu navegador. Las etiquetas de tus bloques, los recuentos de tokens, la selección de modelo y todos los resultados calculados se procesan localmente en tu dispositivo y nunca se envían a ningún servidor. Tus datos permanecen 100 % privados: sin registro, sin rastreo y sin subidas.