Calculadora de tokens de arquivos
Estime a contagem de tokens de arquivos PDF, Markdown, JSON, HTML, código-fonte, CSV e mais, localmente no seu navegador. Envie quantos arquivos quiser para ver estimativas por arquivo e totais, comparar custos de entrada em GPT-4o, Claude, Gemini, DeepSeek e Llama, e checar o uso da janela de contexto. 100 % privado: nenhum arquivo sai do seu dispositivo.
Upload files locally to estimate token counts for PDFs, Markdown, JSON, HTML, source code, CSV, and more. Compare token usage across AI models and calculate input costs - runs 100% in your browser, no data leaves your device.
Drop files here or click to browse
PDF, Markdown, JSON, HTML, source code, CSV, YAML, and more
Multiple files supported · Processed locally · No uploads
Supported formats: PDF, Markdown (.md), JSON, HTML/XML, CSV, source code (.py, .js, .ts, .go, .rs, .java…), YAML, and plain text
All processing happens locally - your files never leave your device
Por que medir tokens antes de enviar um arquivo
Cada arquivo enviado a um modelo consome tokens e dinheiro. Medir antes evita erros de contexto, custos inesperados e reenvios desnecessários.
Envie os arquivos, selecione o modelo e confira os tokens estimados por arquivo, o total e o uso da janela de contexto.
- Prosa em inglês: ~3,8-4,0 caracteres por token.
- Código: ~3,2-3,4 caracteres por token por causa de símbolos e indentação.
- HTML/XML: ~3,0-3,2 caracteres por token pela densidade de tags.
Limites da extração de PDF
Nem todo PDF contém texto acessível. Digitalizados são imagens, e arquivos criptografados ou muito comprimidos podem esconder os fluxos de texto.
- Contagem baixa inesperada geralmente indica PDF digitalizado como imagem.
- PDFs com fontes embutidas podem devolver texto incompleto.
- Para contagem exata, extraia o texto com uma biblioteca dedicada e use o contador de texto simples.
Planejar a divisão quando o arquivo não cabe
Quando o conteúdo excede a janela do modelo, é preciso dividi-lo antes do envio. A calculadora mostra o tamanho do excesso.
- Verifique o uso de contexto do arquivo ou do lote completo.
- Se passar de 100 %, calcule quantos chunks você precisa conforme o tamanho escolhido.
- Escolha um modelo com janela maior se quiser evitar a divisão.
- Compare o custo de entrada de cada opção antes de decidir.
Perguntas frequentes
É uma ferramenta no navegador que lê localmente os arquivos enviados, extrai o texto legível e estima quantos tokens esse conteúdo usaria ao ser enviado a uma API de modelo de linguagem como GPT-4o, Claude ou Gemini. Suporta tipos como PDF, Markdown, JSON, HTML, código-fonte e CSV, e roda totalmente no seu navegador, sem enviar nada a servidor.
Suporta PDF, Markdown (.md, .mdx), JSON e JSONL, HTML, XML/SVG, CSV e TSV, arquivos de código-fonte (.py, .js, .ts, .tsx, .go, .rs, .java, .c, .cpp, .cs, .rb, .php, .swift, .kt, .sh), YAML, TOML, INI, .env, SQL, CSS/SCSS e texto simples. Arquivos DOCX também são suportados via extração de texto XML.
As estimativas usam proporções médias de caracteres por token por tipo de arquivo: cerca de 3,8-4,0 caracteres/token em prosa inglesa, ~3,2-3,4 em código e ~3,0-3,2 em HTML/XML. São aproximações padrão do setor. Para cobrança crítica em produção, valide com o tokenizador oficial do seu fornecedor.
Não. Todo o processamento acontece no seu navegador usando a API File. Seus arquivos são lidos do disco para a memória local do navegador, processados em JavaScript e depois liberados. Nenhum dado de arquivo, texto extraído ou resultado de tokens é transmitido a servidor algum ou a terceiros.
A extração funciona analisando fluxos de texto não comprimidos (blocos BT/ET) dentro do binário do PDF. PDFs comprimidos, criptografados, digitalizados como imagem e com fontes embutidas podem não ter fluxos de texto totalmente acessíveis, reduzindo a contagem. Para contagens precisas, extraia o texto com uma biblioteca de PDF no servidor e use depois o contador de texto simples.
Sim. Você pode arrastar e soltar vários arquivos na área de envio ao mesmo tempo, ou usar o seletor de arquivos para escolher vários. Cada arquivo é processado individualmente e os totais por arquivo e agregados são exibidos. Você pode remover arquivos individualmente sem limpar todos os resultados.
Quando a estimativa de tokens de um arquivo ultrapassa o limite da janela do modelo selecionado, a barra de uso fica vermelha e mostra «>100 %». Você pode trocar para um modelo com janela maior (como Gemini 2.5 Pro com 2 M de tokens ou Claude Sonnet 4 com 1 M) para checar compatibilidade, ou planejar uma estratégia de divisão em chunks.
Sim, a calculadora é totalmente gratuita, sem conta, sem cadastro e sem limites de uso. Roda 100 % no seu navegador com JavaScript no lado do cliente. Não há taxas por arquivo, planos de assinatura nem limites de requisições.