Calculadora de caracteres a tokens
Estima gratis el número de tokens de LLM a partir de caracteres. Aplica ratios precisos de caracteres por token para prosa y código en GPT-4o, Claude, Gemini y 7 modelos más. Compara costes y uso de la ventana de contexto al instante — totalmente privado y sin registro.
Estimate token counts from character counts for any LLM - instantly, in your browser. Select your model and content type to apply accurate chars-per-token ratios, then see per-request and projected monthly API costs.
Volume Forecast
Estimated Tokens
~263
for 1,000 chars
Chars / Token
~3.80
prose
Input Cost / Req
$0.000657
GPT-4o
Monthly Input Cost
$19.73
30,000 requests
Context Window Usage
127,737 tokens remaining
Cost Breakdown per Request
If sent as Input (Prompt)
$0.000657
$2.50/M tokens
If Generated as Output
$0.002630
$10.00/M tokens
Quick Reference - GPT-4o (prose)
| Characters | Est. Tokens | Input Cost | Context % |
|---|---|---|---|
| 1,000 chars | ~263 | $0.000657 | 0% |
| 5,000 chars | ~1,316 | $0.003290 | 1% |
| 10,000 chars | ~2,632 | $0.006580 | 2% |
| 50,000 chars | ~13,158 | $0.0329 | 10% |
| 100,000 chars | ~26,316 | $0.0658 | 21% |
| 500,000 chars | ~131,579 | $0.3289 | Over |
| 1,000,000 chars | ~263,158 | $0.6579 | Over |
Token Estimate Across Models
Sorted by lowest monthly cost| Model | Ratio | Est. Tokens | Monthly Input Cost | Ctx % |
|---|---|---|---|---|
GPT-4o miniOpenAIBest Value | ~3.80 | ~263 | $1.18 | 0% |
DeepSeek-V3DeepSeekBest Value | ~3.80 | ~263 | $2.13 | 0% |
Gemini 2.5 FlashGoogleBest Value | ~4.00 | ~250 | $2.25 | 0% |
Llama 3.1 70BMetaBest Value | ~3.80 | ~263 | $5.68 | 0% |
Claude HaikuAnthropicBest Value | ~3.90 | ~256 | $6.14 | 0% |
Gemini 2.5 ProGoogle | ~4.00 | ~250 | $9.38 | 0% |
Mistral LargeMistral | ~4.00 | ~250 | $15.00 | 0% |
GPT-4oOpenAI Selected | ~3.80 | ~263 | $19.72 | 0% |
Claude SonnetAnthropic | ~3.90 | ~256 | $23.04 | 0% |
Grok 3xAI | ~3.90 | ~256 | $23.04 | 0% |
Por qué importa contar tokens antes de escribir el texto
El coste de una llamada a un LLM y el espacio que ocupa en la ventana de contexto se miden en tokens, no en caracteres. Cuando aún no tienes el texto final, estimar desde caracteres es la forma más rápida de dimensionar un sistema o un presupuesto.
Introduce el número de caracteres y elige el tipo de contenido (prosa o código) y el modelo para obtener los tokens estimados, el uso de la ventana de contexto y el coste.
- Prosa en inglés: aproximadamente 4 caracteres por token.
- Código: aproximadamente 3,0-3,4 caracteres por token por los símbolos y la indentación.
- El margen de error habitual de la estimación es de ±10-15 % en prosa.
Diferencias de ratio entre modelos
Cada familia de modelos usa su propio tokenizador, así que el mismo texto puede contar distinto en GPT-4o, Claude o Gemini. Para comparar costes entre proveedores, aplica el ratio que corresponde a cada uno.
- Comparar precios con un único ratio común infravalora o sobrevalora algunos modelos.
- El contenido multilingüe tiende a consumir más tokens por carácter que el inglés.
- Valida con el tokenizador oficial cuando el presupuesto sea crítico.
Cómo llegar de caracteres a un presupuesto
La estimación de tokens es el primer paso; el presupuesto completo añade el volumen de llamadas y los tokens de salida previstos.
- Cuenta los caracteres de un texto representativo y conviértelos a tokens con el modelo elegido.
- Multiplica por el número de llamadas previstas al día o al mes.
- Añade los tokens de salida esperados, que suelen costar más que los de entrada.
- Comprueba que el total por petición cabe cómodamente en la ventana de contexto del modelo.
Preguntas frecuentes
Estima el número de tokens de LLM que hay en un número de caracteres dado. En lugar de pasar tu texto por una librería de tokenización, introduces el recuento de caracteres y la calculadora aplica el ratio medio de caracteres por token del modelo para darte una estimación rápida. Es útil para planificar presupuestos, diseñar sistemas y prever costes antes de tener el texto real.
En prosa en inglés, un token equivale aproximadamente a 3,8-4,0 caracteres de media en los modelos principales (GPT-4o, Claude, Gemini). En código fuente el ratio baja a unos 3,0-3,4 caracteres por token, porque los símbolos, operadores y la indentación generan tokens. Como regla rápida, divide el número de caracteres entre 4 para prosa en inglés o entre 3,2 para contenido con mucho código.
Con un ratio medio de 4 caracteres por token en prosa inglesa, 1.000 caracteres son aproximadamente 250 tokens. En código, con ~3,2 caracteres por token, 1.000 caracteres son unos 312 tokens. Son estimaciones: el número exacto depende de las palabras, los símbolos concretos y el tokenizador del modelo.
Los tokenizadores de LLM se entrenan sobre todo con texto en inglés, así que tokenizan palabras inglesas comunes con eficiencia, como un solo token. El código contiene muchos símbolos de un carácter (llaves, operadores, punto y coma), identificadores cortos y espacios de indentación que generan uno o más tokens pero representan muy pocos caracteres. Por eso el mismo número de caracteres en código produce más tokens, y mayor coste de API, que en prosa.
Se basan en los ratios medios publicados de caracteres por token de cada familia de modelos y son precisas en un margen de ±10-15 % para prosa en inglés. Para uso en producción o planificación de presupuesto crítica, recomendamos validar con la librería de tokenización del proveedor (tiktoken para OpenAI, el tokenizador de Anthropic para Claude, etc.). La calculadora es más útil en planificación temprana, cuando aún no tienes el texto exacto.
Sí. El recuento de caracteres de esta calculadora incluye todos los caracteres del texto: letras, dígitos, espacios, puntuación, saltos de línea y caracteres especiales. Así es como procesan el texto los tokenizadores de LLM. Los espacios y la puntuación contribuyen al número de tokens, sobre todo cuando aparecen junto a palabras en patrones que el tokenizador reconoce como unidades distintas.
Sí, por completo. La calculadora funciona íntegramente en el lado del cliente, en tu navegador. No se transmite ningún dato a ningún servidor: solo introduces un número y todos los cálculos ocurren localmente en tu dispositivo. No requiere registro y no se almacena nada.