Aller au contenu
Aback Tools Logo

Calculateur de tokens de fichiers

Estimez le nombre de tokens de fichiers PDF, Markdown, JSON, HTML, code source, CSV et plus, localement dans votre navigateur. Importez autant de fichiers que vous voulez pour voir les estimations par fichier et totales, comparer les coûts d'entrée sur GPT-4o, Claude, Gemini, DeepSeek et Llama, et vérifier l'utilisation de la fenêtre de contexte. 100 % privé : aucun fichier ne quitte votre appareil.

File Token Calculator

Upload files locally to estimate token counts for PDFs, Markdown, JSON, HTML, source code, CSV, and more. Compare token usage across AI models and calculate input costs - runs 100% in your browser, no data leaves your device.

~3.8 chars/tokenContext: 128,000 tokensInput/1M: $2.500

Drop files here or click to browse

PDF, Markdown, JSON, HTML, source code, CSV, YAML, and more

Multiple files supported · Processed locally · No uploads

Supported formats: PDF, Markdown (.md), JSON, HTML/XML, CSV, source code (.py, .js, .ts, .go, .rs, .java…), YAML, and plain text

All processing happens locally - your files never leave your device

Estimation Notes:Token counts are estimates based on average characters-per-token ratios for each file type (English prose ~3.8-4.0 chars/token; code ~3.2-3.4; HTML/XML ~3.0-3.2). PDF token extraction is limited to uncompressed text streams - password-protected or image-only PDFs will show lower counts. DOCX files use XML text extraction. For precise production counts, run each file through your provider's official tokenizer (e.g. tiktoken for OpenAI). All processing runs locally in your browser - no file data is ever uploaded.

Pourquoi mesurer les tokens avant d'envoyer un fichier

Chaque fichier envoyé à un modèle consomme des tokens et de l'argent. Les mesurer à l'avance évite les erreurs de contexte, les coûts imprévus et les renvois inutiles.

Importez vos fichiers, choisissez le modèle et consultez les tokens estimés par fichier, le total et l'utilisation de la fenêtre de contexte.

  • Prose anglaise : ~3,8-4,0 caractères par token.
  • Code : ~3,2-3,4 caractères par token à cause des symboles et indentations.
  • HTML/XML : ~3,0-3,2 caractères par token du fait de la densité des balises.

Les limites de l'extraction PDF

Tous les PDF ne contiennent pas de texte accessible. Les scannés sont des images, et les chiffrés ou très compressés peuvent masquer leurs flux de texte.

  • Un comptage anormalement faible indique souvent un PDF scanné.
  • Les PDF à polices intégrées peuvent renvoyer un texte incomplet.
  • Pour un comptage exact, extrayez le texte avec une bibliothèque dédiée puis utilisez le compteur de texte brut.

Prévoir le découpage quand le fichier ne tient pas

Quand le contenu dépasse la fenêtre du modèle, il faut le découper avant l'envoi. Le calculateur indique l'ampleur du dépassement.

  1. Vérifiez l'utilisation de contexte du fichier ou du lot complet.
  2. Si elle dépasse 100 %, calculez le nombre de chunks nécessaires selon la taille choisie.
  3. Choisissez un modèle à plus grande fenêtre si vous voulez éviter le découpage.
  4. Comparez le coût d'entrée de chaque option avant de décider.

Foire aux questions

C'est un outil basé navigateur qui lit localement les fichiers importés, en extrait le texte lisible et estime le nombre de tokens utilisés si ce contenu était envoyé à une API de modèle de langage comme GPT-4o, Claude ou Gemini. Il prend en charge des types comme PDF, Markdown, JSON, HTML, code source et CSV, et fonctionne entièrement dans votre navigateur, sans envoi à un serveur.

PDF, Markdown (.md, .mdx), JSON et JSONL, HTML, XML/SVG, CSV et TSV, fichiers de code source (.py, .js, .ts, .tsx, .go, .rs, .java, .c, .cpp, .cs, .rb, .php, .swift, .kt, .sh), YAML, TOML, INI, .env, SQL, CSS/SCSS et texte brut. Les fichiers DOCX sont aussi pris en charge via l'extraction de texte XML.

Les estimations reposent sur les ratios moyens de caractères par token par type de fichier : environ 3,8-4,0 caractères/token pour la prose anglaise, ~3,2-3,4 pour le code et ~3,0-3,2 pour HTML/XML. Ce sont des approximations standards du secteur. Pour une facturation critique, vérifiez avec le tokenizer officiel de votre fournisseur.

Non. Tout le traitement se fait dans votre navigateur via l'API File. Vos fichiers sont lus depuis le disque dans la mémoire locale du navigateur, traités en JavaScript, puis libérés. Aucune donnée de fichier, texte extrait ou résultat de tokens n'est transmis à un serveur ou à un tiers.

L'extraction s'appuie sur l'analyse des flux de texte non compressés (blocs BT/ET) du binaire PDF. Les PDF compressés, chiffrés, scannés en image ou avec polices intégrées peuvent ne pas exposer tout leur texte, ce qui réduit le comptage. Pour un comptage précis, extrayez d'abord le texte avec une bibliothèque PDF côté serveur, puis utilisez le compteur de texte brut.

Oui. Vous pouvez glisser-déposer plusieurs fichiers sur la zone dédiée, ou utiliser le sélecteur de fichiers pour en choisir plusieurs. Chaque fichier est traité individuellement et les totaux par fichier et globaux sont affichés. Vous pouvez retirer un fichier sans effacer tous les résultats.

Lorsque l'estimation dépasse la limite de contexte du modèle sélectionné, la barre d'utilisation devient rouge et affiche « >100 % ». Vous pouvez passer à un modèle à plus grande fenêtre (comme Gemini 2.5 Pro avec 2 M de tokens ou Claude Sonnet 4 avec 1 M) pour vérifier la compatibilité, ou prévoir une stratégie de découpage.

Oui, le calculateur est totalement gratuit, sans compte, sans inscription et sans limite d'usage. Il fonctionne 100 % dans votre navigateur en JavaScript côté client. Aucun frais par fichier, aucun palier d'abonnement, aucune limite de requêtes.