Saltar al contenido
Aback Tools Logo

Calculadora de tokens de archivos

Estima el número de tokens de archivos PDF, Markdown, JSON, HTML, código fuente, CSV y más, localmente en tu navegador. Sube los archivos que quieras para ver estimaciones por archivo y totales, comparar costes de entrada en GPT-4o, Claude, Gemini, DeepSeek y Llama, y comprobar la utilización de la ventana de contexto. 100 % privado: ningún archivo sale de tu dispositivo.

File Token Calculator

Upload files locally to estimate token counts for PDFs, Markdown, JSON, HTML, source code, CSV, and more. Compare token usage across AI models and calculate input costs - runs 100% in your browser, no data leaves your device.

~3.8 chars/tokenContext: 128,000 tokensInput/1M: $2.500

Drop files here or click to browse

PDF, Markdown, JSON, HTML, source code, CSV, YAML, and more

Multiple files supported · Processed locally · No uploads

Supported formats: PDF, Markdown (.md), JSON, HTML/XML, CSV, source code (.py, .js, .ts, .go, .rs, .java…), YAML, and plain text

All processing happens locally - your files never leave your device

Estimation Notes:Token counts are estimates based on average characters-per-token ratios for each file type (English prose ~3.8-4.0 chars/token; code ~3.2-3.4; HTML/XML ~3.0-3.2). PDF token extraction is limited to uncompressed text streams - password-protected or image-only PDFs will show lower counts. DOCX files use XML text extraction. For precise production counts, run each file through your provider's official tokenizer (e.g. tiktoken for OpenAI). All processing runs locally in your browser - no file data is ever uploaded.

Por qué conviene medir tokens antes de enviar un archivo

Cada archivo que envías a un modelo consume tokens y dinero. Medirlos antes evita errores de contexto, costes inesperados y reintentos innecesarios.

Sube los archivos, selecciona el modelo y revisa los tokens estimados por archivo, el total y la utilización de la ventana de contexto.

  • Prosa en inglés: ~3,8-4,0 caracteres por token.
  • Código: ~3,2-3,4 caracteres por token por los símbolos y la indentación.
  • HTML/XML: ~3,0-3,2 caracteres por token por la densidad de etiquetas.

Límites de la extracción desde PDF

No todos los PDF contienen texto accesible. Los escaneados son imágenes, y los cifrados o muy comprimidos pueden ocultar sus flujos de texto.

  • Un recuento bajo inesperado suele indicar que el PDF es una imagen escaneada.
  • Los PDF con fuentes incrustadas pueden devolver texto incompleto.
  • Para facturación exacta, extrae el texto con una librería dedicada y usa el contador de texto plano.

Planificar la fragmentación cuando el archivo no cabe

Cuando el contenido excede la ventana del modelo, hay que dividirlo antes de enviarlo. La calculadora te dice de cuánto es el exceso.

  1. Comprueba la utilización de contexto del archivo o del lote completo.
  2. Si supera el 100 %, calcula cuántos fragmentos necesitas según el tamaño elegido.
  3. Elige un modelo con ventana mayor si quieres evitar la fragmentación.
  4. Revisa el coste de entrada de cada opción antes de decidir.

Preguntas frecuentes

Es una herramienta basada en navegador que lee los archivos subidos localmente, extrae su contenido de texto legible y estima cuántos tokens usaría ese contenido al enviarse a una API de modelo de lenguaje como GPT-4o, Claude o Gemini. Admite tipos como PDF, Markdown, JSON, HTML, código fuente y CSV, y funciona íntegramente en tu navegador sin subir nada a un servidor.

Admite PDF, Markdown (.md, .mdx), JSON y JSONL, HTML, XML/SVG, CSV y TSV, archivos de código fuente (.py, .js, .ts, .tsx, .go, .rs, .java, .c, .cpp, .cs, .rb, .php, .swift, .kt, .sh), YAML, TOML, INI, .env, SQL, CSS/SCSS y texto plano. También admite archivos DOCX mediante extracción de texto XML.

Las estimaciones se basan en ratios medios de caracteres por token para cada tipo de archivo: aproximadamente 3,8-4,0 caracteres/token en prosa inglesa, ~3,2-3,4 en código y ~3,0-3,2 en HTML/XML. Son aproximaciones estándar del sector. Para facturación crítica en producción, verifica con el tokenizador oficial de tu proveedor.

No. Todo el procesamiento ocurre en tu navegador mediante la API File del navegador. Tus archivos se leen del disco a la memoria local del navegador, se procesan con JavaScript y luego se liberan. Ningún dato de archivo, texto extraído o resultado de tokens se transmite a servidor alguno ni a terceros.

La extracción de tokens de PDF funciona analizando los flujos de texto sin comprimir (bloques BT/ET) dentro del binario del PDF. Los PDF comprimidos, cifrados, escaneados como imagen y con fuentes incrustadas pueden no tener flujos de texto totalmente accesibles, lo que reduce el recuento de caracteres. Para conteos de PDF muy precisos, extrae primero el texto con una librería de PDF del lado del servidor y usa después el contador de texto plano.

Sí. Puedes arrastrar y soltar varios archivos en la zona de carga simultáneamente, o usar el explorador de archivos para seleccionar varios a la vez. Cada archivo se procesa individualmente y se muestran los totales por archivo y agregados. Puedes eliminar archivos individuales sin borrar todos los resultados.

Cuando la estimación de tokens de un archivo supera el límite de la ventana de contexto del modelo seleccionado, la barra de uso se pone roja y muestra un indicador de «>100 %». Puedes cambiar a un modelo con una ventana mayor (como Gemini 2.5 Pro con 2 M de tokens o Claude Sonnet 4 con 1 M) para comprobar la compatibilidad, o planificar una estrategia de fragmentación.

Sí, la calculadora de tokens de archivos es totalmente gratis, sin cuenta, sin registro y sin límites de uso. Funciona 100 % en tu navegador con JavaScript del lado del cliente. No hay tarifas por archivo, ni planes de suscripción, ni límites de peticiones.