Aller au contenu
Aback Tools Logo

Calculateur mots en tokens

Estimez gratuitement le nombre de tokens à partir d'un nombre de mots, en ligne, grâce à des ratios mots/tokens propres à chaque modèle pour GPT, Claude, Gemini, DeepSeek, Llama, Mistral et d'autres. Saisissez un nombre de mots, collez un texte ou choisissez un préréglage de contenu, puis consultez instantanément les tokens, les coûts d'API et l'utilisation de la fenêtre de contexte sur 15 modèles.

Word to Token Calculator

Estimate token counts from word counts using model-specific word-to-token ratios for 15 leading AI models. Enter words manually, paste text, or pick a content preset - then see token estimates, API costs, and context window usage instantly.

Word Count

words
050K100K

Quick Presets

Ratio: ~1.30 tokens/wordContext: 128.0K tokensInput/1M: $2.50

Baseline: ~1.3 tokens/word

Usage Forecast

reqs

Est. Tokens

~975

GPT-4o

Words

750

input count

Ratio Used

1.30×

English Prose

Context Window Usage - GPT-4o

975 used of 128.0K1% used

127.0K tokens remaining (99% free)

Monthly Input Cost - 30,000 requests

$73.13if used as prompt input

Per Request

$0.002437

If Generated (Output)

$292.50

Token Estimate

~975

Token Count Across Models

Sorted by cheapest monthly cost
ModelTokens/WordEst. TokensMonthly Input CostContext
MetaLlama 4 ScoutBudget
×1.30~975$2.930% used
MistralMistral SmallBudget
×1.32~990$2.971% used
DeepSeekDeepSeek V4 FlashBudget
×1.30~975$4.100% used
OpenAIGPT-4o MiniBudget
×1.30~975$4.391% used
GoogleGemini 2.5 FlashBudget
×1.25~938$8.440% used
DeepSeekDeepSeek V4 ProBudget
×1.30~975$12.720% used
AnthropicClaude Haiku 4.5Budget
×1.28~960$28.800% used
GoogleGemini 2.5 ProCapable
×1.25~938$35.180% used
GoogleGemini 3.5 FlashBudget
×1.25~938$42.210% used
OpenAIo3 (Reasoning)Capable
×1.30~975$58.500% used
MistralMistral LargeCapable
×1.32~990$59.401% used
OpenAIGPT-4o Selected
×1.30~975$73.131% used
OpenAIGPT-5.4Capable
×1.30~975$73.130% used
AnthropicClaude Sonnet 4.6Capable
×1.28~960$86.400% used
AnthropicClaude Opus 4.8Capable
×1.28~960$144.000% used
Estimation Note:Token counts are estimates based on average words-per-token ratios derived from published tokenizer benchmarks. English prose averages ~1.3 tokens per word for GPT/Llama BPE tokenizers and ~1.25-1.28 for Gemini and Claude. Actual counts vary by content - code, JSON, URLs, and non-Latin scripts tokenize differently. For exact counts, use the provider's official tokenizer (e.g. tiktoken for OpenAI).

Pourquoi utiliser notre calculateur mots en tokens

Les LLM ne lisent pas mot à mot : ils découpent le texte en tokens de 2 à 6 caractères. En prose anglaise, un mot correspond en moyenne à environ 1,3 token, mais le ratio varie selon la famille de modèles et le type de contenu. Ce calculateur applique des ratios propres à 15 modèles majeurs pour budgétiser et planifier sans exécuter de code ni appeler aucune API.

Tout est calculé dans votre navigateur : ni votre texte ni vos nombres de mots ne quittent votre appareil.

  • Estimations instantanées : saisissez un nombre, utilisez le curseur ou collez du texte, les tokens se mettent à jour en temps réel.
  • Calculs privés : nombres de mots, texte collé et estimations sont traités entièrement dans votre navigateur.
  • Ratios propres à chaque modèle pour 15 modèles d'OpenAI, Anthropic, Google, DeepSeek, Meta et Mistral.
  • Projections de coûts et de fenêtre de contexte : coût d'entrée par requête, prévision mensuelle ou annuelle et barre visuelle d'utilisation du contexte.

Cas d'usage courants

De la planification du budget d'API à la conception de pipelines RAG, voici les scénarios les plus courants.

  • Planifier un budget d'API : estimer le nombre de tokens d'une requête moyenne et son coût à grande échelle.
  • Prompt engineering : vérifier que le prompt système, les exemples et l'entrée tiennent dans la fenêtre de contexte.
  • Conception de pipeline RAG : estimer les tokens consommés par chaque segment récupéré avant de créer le vector store.
  • Dimensionnement de contenu : vérifier qu'un article, un rapport ou un chapitre tient dans la fenêtre de contexte.
  • Comparaison de coûts entre modèles : identifier le modèle le plus rentable pour votre charge de travail et votre langue.
  • Apprentissage : comprendre pourquoi le code ou le texte CJK consomme bien plus de tokens que la prose anglaise.

Comment fonctionne la conversion mots en tokens

Le ratio de base en prose anglaise est d'environ 0,75 mot par token (1,3 token par mot), mais chaque type de contenu le modifie : code ×1,20, Markdown technique ×1,15 et texte non anglais ou CJK jusqu'à ×1,60.

Le calculateur fournit des estimations, pas des comptages exacts. Le nombre réel dépend du tokenizer de chaque fournisseur : OpenAI utilise tiktoken (BPE), Anthropic un tokenizer maison basé sur SentencePiece et Google Gemini un SentencePiece adapté au multilingue. Les cas limites comme les URL, nombres, emojis ou le jargon technique peuvent largement dépasser le ratio standard.

  1. Saisissez un nombre de mots : saisie manuelle, curseur, préréglages (tweet, article de blog, article scientifique) ou collez et importez du texte.
  2. Choisissez le modèle (15 options) et le type de contenu : prose anglaise, code, Markdown technique, non anglais ou JSON.
  3. Définissez votre prévision d'usage : requêtes par jour, mois ou an pour voir le coût d'entrée projeté.
  4. Analysez les résultats : tokens estimés, utilisation de la fenêtre de contexte, prévision de coût et tableau de comparaison entre modèles.

Foire aux questions

Pour de la prose anglaise standard, 1 000 mots correspondent à environ 1 300 tokens avec les tokenizers des familles GPT ou Llama, environ 1 280 tokens pour Claude et environ 1 250 tokens pour les modèles Gemini. Ces estimations utilisent le ratio moyen mots/tokens publié par chaque modèle. Le code, le JSON et les textes non anglais produisent davantage de tokens pour un même nombre de mots.

Chaque fournisseur entraîne un tokenizer différent (vocabulaire et algorithme de découpage). OpenAI utilise tiktoken avec un vocabulaire BPE de 100 000 tokens. Anthropic Claude utilise un tokenizer SentencePiece personnalisé. Google Gemini utilise aussi SentencePiece, mais adapté au multilingue. Ces tokenizers découpent le même texte en segments légèrement différents, avec des écarts de 2 à 5 % en anglais.

Pour de la prose anglaise standard, les estimations restent en général à moins de 5 % du nombre réel donné par le tokenizer officiel du fournisseur. La précision baisse pour le code, les données structurées, les URL, les nombres et les alphabets non latins. Pour des comptages exacts en production, utilisez la bibliothèque de tokenization officielle du fournisseur.

Pour la prose anglaise, la moyenne du secteur est d'environ 0,75 mot par token, soit environ 1,3 token par mot. Ce chiffre provient de la documentation publiée par OpenAI et a été confirmé par des benchmarks indépendants sur les principales familles de modèles.

Le code source contient de nombreux caractères rares en prose anglaise : crochets, opérateurs, tirets bas, points-virgules et identifiants composés. Les tokenizers BPE les découpent différemment des mots naturels, produisant souvent plus de tokens par mot que la prose.

Oui. Saisissez le nombre approximatif de mots de la taille de segment prévue, sélectionnez le modèle cible et le calculateur indique combien de tokens ce segment consommera. Une règle courante est de garder chaque segment sous 512 tokens, soit environ 395 mots pour les modèles de la famille GPT.

Totalement. Le calculateur mots en tokens fonctionne à 100 % dans votre navigateur. Lorsque vous collez ou importez du texte, il est traité localement sur votre appareil : jamais envoyé à un serveur, jamais stocké, jamais transmis sur le réseau. Votre contenu reste entièrement privé.

Sélectionnez le type de contenu "Non anglais (CJK, etc.)" pour appliquer un multiplicateur de 1,60× au ratio de base mots/tokens. Le chinois, le japonais, le coréen et les autres alphabets non latins demandent généralement beaucoup plus de tokens par caractère que l'anglais dans les tokenizers BPE standard.