Calculadora de caracteres para tokens
Estime gratuitamente a contagem de tokens de LLM a partir de caracteres. Aplique proporções precisas de caracteres por token para texto e código em GPT-4o, Claude, Gemini e mais 7 modelos. Compare custos e uso da janela de contexto na hora — totalmente privado e sem cadastro.
Estimate token counts from character counts for any LLM - instantly, in your browser. Select your model and content type to apply accurate chars-per-token ratios, then see per-request and projected monthly API costs.
Volume Forecast
Estimated Tokens
~263
for 1,000 chars
Chars / Token
~3.80
prose
Input Cost / Req
$0.000657
GPT-4o
Monthly Input Cost
$19.73
30,000 requests
Context Window Usage
127,737 tokens remaining
Cost Breakdown per Request
If sent as Input (Prompt)
$0.000657
$2.50/M tokens
If Generated as Output
$0.002630
$10.00/M tokens
Quick Reference - GPT-4o (prose)
| Characters | Est. Tokens | Input Cost | Context % |
|---|---|---|---|
| 1,000 chars | ~263 | $0.000657 | 0% |
| 5,000 chars | ~1,316 | $0.003290 | 1% |
| 10,000 chars | ~2,632 | $0.006580 | 2% |
| 50,000 chars | ~13,158 | $0.0329 | 10% |
| 100,000 chars | ~26,316 | $0.0658 | 21% |
| 500,000 chars | ~131,579 | $0.3289 | Over |
| 1,000,000 chars | ~263,158 | $0.6579 | Over |
Token Estimate Across Models
Sorted by lowest monthly cost| Model | Ratio | Est. Tokens | Monthly Input Cost | Ctx % |
|---|---|---|---|---|
GPT-4o miniOpenAIBest Value | ~3.80 | ~263 | $1.18 | 0% |
DeepSeek-V3DeepSeekBest Value | ~3.80 | ~263 | $2.13 | 0% |
Gemini 2.5 FlashGoogleBest Value | ~4.00 | ~250 | $2.25 | 0% |
Llama 3.1 70BMetaBest Value | ~3.80 | ~263 | $5.68 | 0% |
Claude HaikuAnthropicBest Value | ~3.90 | ~256 | $6.14 | 0% |
Gemini 2.5 ProGoogle | ~4.00 | ~250 | $9.38 | 0% |
Mistral LargeMistral | ~4.00 | ~250 | $15.00 | 0% |
GPT-4oOpenAI Selected | ~3.80 | ~263 | $19.72 | 0% |
Claude SonnetAnthropic | ~3.90 | ~256 | $23.04 | 0% |
Grok 3xAI | ~3.90 | ~256 | $23.04 | 0% |
Por que contar tokens antes de escrever o texto
O custo de uma chamada a um LLM e o espaço que ela ocupa na janela de contexto são medidos em tokens, não em caracteres. Quando o texto final ainda não existe, estimar a partir de caracteres é a forma mais rápida de dimensionar um sistema ou um orçamento.
Informe a contagem de caracteres e escolha o tipo de conteúdo (texto ou código) e o modelo para obter tokens estimados, uso da janela de contexto e custo.
- Texto em inglês: aproximadamente 4 caracteres por token.
- Código: cerca de 3,0-3,4 caracteres por token por causa de símbolos e indentação.
- A margem de erro típica da estimativa é de ±10-15 % em texto comum.
Diferenças de proporção entre modelos
Cada família de modelos usa seu próprio tokenizador, então o mesmo texto pode contar diferente no GPT-4o, Claude ou Gemini. Para comparar custos entre fornecedores, aplique a proporção correspondente a cada um.
- Comparar preços com uma única proporção comum subestima ou superestima alguns modelos.
- Conteúdo multilíngue costuma consumir mais tokens por caractere que o inglês.
- Valide com o tokenizador oficial quando o orçamento for crítico.
Dos caracteres ao orçamento
A estimativa de tokens é o primeiro passo; o orçamento completo soma o volume de chamadas e os tokens de saída previstos.
- Conte os caracteres de um texto representativo e converta para tokens no modelo escolhido.
- Multiplique pelo número de chamadas previstas por dia ou por mês.
- Some os tokens de saída esperados, que costumam custar mais que os de entrada.
- Confirme que o total por requisição cabe com folga na janela de contexto do modelo.
Perguntas frequentes
Ela estima quantos tokens de LLM existem em determinada contagem de caracteres. Em vez de passar seu texto por uma biblioteca de tokenização, você informa a contagem de caracteres e a calculadora aplica a proporção média de caracteres por token do modelo. É útil para planejamento de orçamento, design de sistemas e previsão de custos antes de ter o texto real.
Em texto em inglês, um token equivale em média a 3,8-4,0 caracteres nos principais modelos (GPT-4o, Claude, Gemini). Em código-fonte, a proporção cai para cerca de 3,0-3,4 caracteres por token, pois símbolos, operadores e indentação geram tokens. Regra rápida: divida por 4 para texto em inglês ou por 3,2 para conteúdo com muito código.
Com proporção média de 4 caracteres por token em inglês, 1.000 caracteres são aproximadamente 250 tokens. Em código, a ~3,2 caracteres por token, 1.000 caracteres são cerca de 312 tokens. São estimativas: a contagem exata depende das palavras, dos símbolos e do tokenizador do modelo.
Os tokenizadores de LLM são treinados principalmente com texto em inglês, então tokenizam palavras inglesas comuns de forma eficiente, em um único token. Código contém muitos símbolos de um caractere (chaves, operadores, ponto e vírgula), identificadores curtos e espaços de indentação que geram um ou mais tokens representando pouquíssimos caracteres. Por isso a mesma contagem de caracteres em código produz mais tokens, e custo de API maior, que em texto comum.
Elas se baseiam nas proporções médias publicadas de caracteres por token de cada família de modelos e são precisas dentro de ±10-15 % para inglês. Para uso em produção ou planejamento de orçamento crítico, recomendamos validar com a biblioteca de tokenização do fornecedor (tiktoken para OpenAI, o tokenizador da Anthropic para Claude etc.). A calculadora é mais útil no planejamento inicial, quando o texto exato ainda não existe.
Sim. A contagem inclui todos os caracteres do texto: letras, dígitos, espaços, pontuação, quebras de linha e caracteres especiais. É assim que os tokenizadores de LLM processam texto. Espaços e pontuação contribuem para a contagem de tokens, sobretudo quando aparecem junto a palavras em padrões que o tokenizador reconhece como unidades distintas.
Sim, totalmente. A calculadora roda inteiramente no lado do cliente, no seu navegador. Nenhum dado é transmitido a servidor algum: você apenas informa um número e todos os cálculos acontecem localmente no seu dispositivo. Não precisa de cadastro e nada é armazenado.