Pular para o conteúdo
Aback Tools Logo

Calculadora de palavras para tokens

Estime a contagem de tokens a partir da contagem de palavras online e grátis com proporções de palavras por token específicas para GPT, Claude, Gemini, DeepSeek, Llama, Mistral e outros. Informe uma contagem de palavras, cole texto ou escolha um preset de conteúdo e veja na hora os tokens, os custos de API e o uso da janela de contexto em 15 modelos.

Word to Token Calculator

Estimate token counts from word counts using model-specific word-to-token ratios for 15 leading AI models. Enter words manually, paste text, or pick a content preset - then see token estimates, API costs, and context window usage instantly.

Word Count

words
050K100K

Quick Presets

Ratio: ~1.30 tokens/wordContext: 128.0K tokensInput/1M: $2.50

Baseline: ~1.3 tokens/word

Usage Forecast

reqs

Est. Tokens

~975

GPT-4o

Words

750

input count

Ratio Used

1.30×

English Prose

Context Window Usage - GPT-4o

975 used of 128.0K1% used

127.0K tokens remaining (99% free)

Monthly Input Cost - 30,000 requests

$73.13if used as prompt input

Per Request

$0.002437

If Generated (Output)

$292.50

Token Estimate

~975

Token Count Across Models

Sorted by cheapest monthly cost
ModelTokens/WordEst. TokensMonthly Input CostContext
MetaLlama 4 ScoutBudget
×1.30~975$2.930% used
MistralMistral SmallBudget
×1.32~990$2.971% used
DeepSeekDeepSeek V4 FlashBudget
×1.30~975$4.100% used
OpenAIGPT-4o MiniBudget
×1.30~975$4.391% used
GoogleGemini 2.5 FlashBudget
×1.25~938$8.440% used
DeepSeekDeepSeek V4 ProBudget
×1.30~975$12.720% used
AnthropicClaude Haiku 4.5Budget
×1.28~960$28.800% used
GoogleGemini 2.5 ProCapable
×1.25~938$35.180% used
GoogleGemini 3.5 FlashBudget
×1.25~938$42.210% used
OpenAIo3 (Reasoning)Capable
×1.30~975$58.500% used
MistralMistral LargeCapable
×1.32~990$59.401% used
OpenAIGPT-4o Selected
×1.30~975$73.131% used
OpenAIGPT-5.4Capable
×1.30~975$73.130% used
AnthropicClaude Sonnet 4.6Capable
×1.28~960$86.400% used
AnthropicClaude Opus 4.8Capable
×1.28~960$144.000% used
Estimation Note:Token counts are estimates based on average words-per-token ratios derived from published tokenizer benchmarks. English prose averages ~1.3 tokens per word for GPT/Llama BPE tokenizers and ~1.25-1.28 for Gemini and Claude. Actual counts vary by content - code, JSON, URLs, and non-Latin scripts tokenize differently. For exact counts, use the provider's official tokenizer (e.g. tiktoken for OpenAI).

Por que usar nossa calculadora de palavras para tokens

Os LLM não leem palavra por palavra: dividem o texto em tokens de 2 a 6 caracteres. Na prosa inglesa, uma palavra equivale em média a cerca de 1,3 token, mas a proporção muda conforme a família do modelo e o tipo de conteúdo. Esta calculadora aplica proporções específicas para 15 modelos importantes, para você orçar e planejar sem executar código nem chamar APIs.

Tudo é calculado no seu navegador: nem seu texto nem suas contagens de palavras saem do seu dispositivo.

  • Estimativas instantâneas: digite um número, use o controle deslizante ou cole texto e os tokens se atualizam em tempo real.
  • Cálculos privados: contagens, texto colado e estimativas são processados por completo no navegador.
  • Proporções específicas por modelo para 15 modelos de OpenAI, Anthropic, Google, DeepSeek, Meta e Mistral.
  • Projeções de custo e janela de contexto: custo de entrada por requisição, previsão mensal ou anual e barra visual de uso do contexto.

Casos de uso comuns

Do planejamento de orçamento de API ao design de pipelines RAG, estes são os cenários mais comuns.

  • Planejar o orçamento de API: estimar quantos tokens tem uma requisição média e quanto custa em escala.
  • Engenharia de prompts: verificar se o prompt de sistema, os exemplos e a entrada cabem na janela de contexto.
  • Design de pipeline RAG: estimar quantos tokens cada trecho recuperado consumirá antes de montar o vector store.
  • Dimensionar conteúdo e documentos: verificar se um artigo, relatório ou capítulo cabe na janela de contexto.
  • Comparar custos entre modelos: identificar o modelo mais econômico para sua carga de trabalho e idioma.
  • Aprendizado: entender por que código ou texto CJK consomem bem mais tokens que a prosa inglesa.

Como funciona a conversão de palavras para tokens

A proporção base em prosa inglesa é de cerca de 0,75 palavra por token (1,3 token por palavra), mas cada tipo de conteúdo a altera: código ×1,20, Markdown técnico ×1,15 e texto não inglês ou CJK até ×1,60.

A calculadora fornece estimativas, não contagens exatas. O número real depende do tokenizador de cada provedor: a OpenAI usa tiktoken (BPE), a Anthropic um tokenizador próprio baseado em SentencePiece e o Google Gemini um SentencePiece voltado ao multilíngue. Casos extremos como URLs, números, emojis ou jargão técnico podem superar bastante a proporção padrão.

  1. Informe uma contagem de palavras: digitação manual, controle deslizante, presets (tweet, post de blog, artigo científico) ou cole e envie texto.
  2. Selecione o modelo (15 opções) e o tipo de conteúdo: prosa inglesa, código, Markdown técnico, não inglês ou JSON.
  3. Defina sua previsão de uso: requisições por dia, mês ou ano para ver o custo de entrada projetado.
  4. Veja os resultados: tokens estimados, uso da janela de contexto, previsão de custo e tabela comparativa entre modelos.

Perguntas frequentes

Em prosa inglesa padrão, 1000 palavras equivalem a aproximadamente 1300 tokens com os tokenizadores das famílias GPT ou Llama, cerca de 1280 tokens para o Claude e cerca de 1250 tokens para os modelos Gemini. Essas estimativas usam a proporção média de palavras por token publicada por cada modelo. Código, JSON e texto não inglês geram contagens maiores para o mesmo número de palavras.

Cada provedor treina um tokenizador diferente (vocabulário e algoritmo de divisão). A OpenAI usa tiktoken com vocabulário BPE de 100 mil tokens. O Anthropic Claude usa um tokenizador SentencePiece próprio. O Google Gemini também usa SentencePiece, mas ajustado para texto multilíngue. Esses tokenizadores dividem o mesmo texto em partes ligeiramente diferentes, com variações de 2 a 5 % em inglês.

Em prosa inglesa padrão, as estimativas costumam ficar dentro de 5 % da contagem real do tokenizador oficial do provedor. A precisão cai para código, dados estruturados, URLs, números e alfabetos não latinos. Para contagens exatas em produção, use a biblioteca de tokenização oficial do provedor.

Em prosa inglesa, a média padrão do setor é de cerca de 0,75 palavra por token, ou seja, aproximadamente 1,3 token por palavra. Esse número vem da documentação publicada pela OpenAI e foi confirmado por benchmarks independentes nas principais famílias de modelos.

O código-fonte tem muitos caracteres incomuns na prosa inglesa: colchetes, operadores, sublinhados, pontos e vírgulas e identificadores compostos. Os tokenizadores BPE os dividem de forma diferente das palavras naturais, gerando muitas vezes mais tokens por palavra do que a prosa.

Sim. Informe a contagem aproximada de palavras do tamanho de chunk planejado, selecione o modelo de destino e a calculadora mostra quantos tokens esse chunk vai consumir. Uma regra comum é manter cada chunk abaixo de 512 tokens, o que corresponde a cerca de 395 palavras em modelos da família GPT.

Totalmente. A calculadora de palavras para tokens roda 100 % no seu navegador. Ao colar ou enviar texto, ele é processado localmente no seu dispositivo: nunca é enviado a servidores, armazenado ou transmitido pela rede. Seu conteúdo permanece totalmente privado.

Selecione o tipo de conteúdo "Não inglês (CJK etc.)" para aplicar um multiplicador de 1,60× sobre a proporção base de palavras por token. Chinês, japonês, coreano e outros alfabetos não latinos costumam exigir bem mais tokens por caractere do que o inglês nos tokenizadores BPE padrão.