Aller au contenu
Aback Tools Logo

Qu’est-ce qu’un calculateur de coût par requête ? Guide des coûts d’API LLM

Découvrez comment un calculateur de coût par requête estime les coûts d’API d’un LLM : jetons, tarifs d’entrée et de sortie, comparaisons de modèles et stratégies pour réduire votre facture IA de 30 à 80 %.

DH
Tips & Best Practices11 min de lecture2,550 mots

Chaque appel d’API à GPT, Claude, Gemini ou à tout autre grand modèle de langage a un coût mesuré en jetons - et ce coût s’accumule vite quand vous montez en charge. Un calculateur de coût par requête traduit les jetons en euros ou en dollars pour budgéter précisément, choisir le bon niveau de modèle et repérer où optimiser avant que votre facture mensuelle d’API ne devienne une surprise.

0,01-0,15 $Coût typique par requêteVariable selon modèle et longueur
30-60 %Économies de jetons possiblesAvec compression de l’entrée
~0,75Mots par jetonMoyenne d’un texte anglais

Qu’est-ce qu’un calculateur de coût par requête ?

Un calculateur de coût par requête est un outil qui estime le coût d’API d’un appel unique à un grand modèle de langage (LLM). Vous indiquez le nombre de jetons d’entrée (votre invite, le contexte et les documents récupérés), le nombre attendu de jetons de sortie (la réponse du modèle) et le modèle visé. Le calculateur multiplie chaque valeur par le tarif par jeton publié du fournisseur et renvoie un coût par requête, ainsi qu’un total mensuel projeté selon le volume d’appels prévu.

Son objectif principal est de rendre les coûts d’IA prévisibles. Sans calculateur, il est facile de sous-estimer la vitesse à laquelle les coûts de jetons s’accumulent à l’échelle. Une requête à 0,012 $ paraît négligeable - mais à 10 000 appels par jour, cela représente 120 $ par jour, soit 3 600 $ par mois, depuis un seul point d’API. Les calculateurs de coût par requête révèlent cela avant le déploiement, et non après.

Ce qu’affiche un calculateur de coût par requête

  • Coût par requête - le montant exact d’un appel d’API avec vos nombres de jetons et votre modèle.
  • Projections journalières et mensuelles - applique le coût par requête à votre volume d’appels prévu.
  • Répartition entrée / sortie - montre la part du coût venant de l’invite et celle venant de la réponse, les jetons de sortie étant plus chers.
  • Comparaison de modèles - certains calculateurs comparent simultanément le coût de la même requête sur plusieurs modèles.

Note

Les calculateurs utilisent les tarifs catalogue des fournisseurs, qui peuvent différer de la facturation réelle si vous bénéficiez de remises de volume négociées, de tarifs d’API par lots ou de jetons d’invite mis en cache. Vérifiez toujours dans le tableau de bord de facturation de votre fournisseur une fois en production.

Comment fonctionne la tarification par jeton des LLM

Les fournisseurs de LLM facturent au jeton, une unité de texte qui correspond à environ 0,75 mot en anglais (soit environ 4 caractères). Les tarifs sont exprimés par million de jetons ($/M), séparément pour l’entrée et la sortie. Les jetons d’entrée incluent tout ce que vous envoyez : l’invite système, l’historique de conversation, le message de l’utilisateur, les extraits de documents récupérés par les pipelines RAG et les schémas de fonctions ou d’outils. Les jetons de sortie correspondent à la réponse générée par le modèle.

Les jetons d’entrée et de sortie sont facturés séparément. Les jetons de sortie coûtent 3 à 5 fois plus cher que ceux d’entrée, car générer du texte coûte plus cher en calcul que traiter du contexte.

- Convention de facturation standard des API LLM, 2024-2026

Pourquoi les jetons de sortie coûtent plus cher

Lors de l’inférence, traiter les jetons d’entrée nécessite une seule passe avant dans le modèle. Générer des jetons de sortie exige une boucle autorégressive : le modèle produit un jeton à la fois, chaque étape dépendant de la précédente. Ce processus séquentiel est bien plus gourmand en GPU par jeton, d’où le supplément notable facturé sur la sortie. Aux tarifs de GPT-4o, l’entrée coûte 2,50 $/M et la sortie 10,00 $/M, soit un facteur 4. Conséquence pratique directe : les réponses longues et verbeuses coûtent disproportionnellement plus cher que les réponses concises.

Comment les jetons se traduisent en longueurs d’invite réelles

  • Invite courte + réponse courte (par ex. « Classe ce texte ») : ~50-200 jetons au total.
  • Message système + requête avec contexte : ~500-2 000 jetons en entrée, 100-500 en sortie.
  • Requête RAG avec extraits de documents : ~2 000-8 000 jetons en entrée, 300-1 000 en sortie.
  • Flux agentique avec résultats d’outils et historique : ~8 000-32 000 jetons en entrée par appel.
  • Génération longue (article, code) : ~1 000-4 000 jetons en entrée, 1 000-4 000 en sortie.

Tip

La règle « 1 jeton ≈ 0,75 mot » vaut pour un texte anglais. Le code et le JSON sont nettement moins efficaces en jetons, car les caractères spéciaux, les espaces et les jetons répétés sont tokenisés avec une densité moindre. Un essai anglais de 1 000 mots utilise environ 1 300 jetons ; 1 000 caractères de JSON utilisent plutôt 300 à 500 jetons au lieu des ~250 que laisserait attendre le ratio de l’anglais.

Comment estimer vos coûts par requête

Estimer précisément ses coûts par requête suppose de connaître trois chiffres : le nombre moyen de jetons d’entrée par appel, le nombre moyen de jetons de sortie par appel et votre volume quotidien d’appels. Les deux premiers se mesurent de préférence empiriquement, avec le compteur de jetons du fournisseur ou le champ `usage` des réponses d’API, plutôt qu’en les estimant à partir du nombre de mots.

Étape 1 - Mesurer l’usage réel des jetons en développement

Chaque réponse d’API LLM contient un objet `usage` indiquant `prompt_tokens`, `completion_tokens` et `total_tokens`. Journalisez ces valeurs pendant le développement sur un échantillon représentatif de 50 à 100 requêtes réelles. Calculez la moyenne et le 95e centile pour l’entrée comme pour la sortie. Pour le dimensionnement des coûts, utilisez le 95e centile d’entrée et la moyenne de sortie : cela tient compte des contextes volumineux atypiques sans surestimer l’appel typique.

Étape 2 - Estimer le volume mensuel

Pour une application en production, estimez : utilisateurs actifs quotidiens × requêtes moyennes par session × appels d’API par requête. Un chatbot avec 1 000 utilisateurs quotidiens, 5 messages par session et 1 appel d’API par message génère 5 000 appels par jour. Multipliez votre coût par appel par le volume quotidien, puis par 30 pour la projection mensuelle. Prévoyez une marge de 30 à 50 % pour les pics de trafic et les itérations d’ingénierie d’invite.

Étape 3 - Comparer les niveaux de modèles

Passez les mêmes nombres de jetons dans plusieurs niveaux de modèles pour repérer les tâches où les exigences de qualité permettent un modèle moins cher. Beaucoup de tâches - classification, extraction d’entités, résumé simple, réponses de FAQ - atteignent une qualité acceptable avec un modèle plus petit et moins cher. Réserver les modèles de pointe (classe GPT-4, classe Claude 3.5 Sonnet) au sous-ensemble de tâches qui les exigent réellement et router les tâches simples vers des modèles moins chers est en général la réduction de coût la plus rentable.

Convertisseur JSON vers TOON

Convertissez du JSON au format compact TOON et réduisez l’usage de jetons d’un LLM de 30 à 60 % - en abaissant directement le coût en jetons d’entrée de chaque requête contenant des données JSON structurées.

Open tool

Comparaison des coûts entre les principaux LLM

Les tarifs des modèles évoluent souvent : les fournisseurs les ont beaucoup réduits à mesure que la concurrence s’intensifie. Le tableau ci-dessous présente des niveaux tarifaires représentatifs de mi-2026 pour illustrer la structure des coûts. Vérifiez toujours les prix actuels sur la page tarifaire officielle de chaque fournisseur avant d’établir des projections de coût en production.

Niveau de modèleEntrée ($/M jetons)Sortie ($/M jetons)Idéal pour
Classe GPT-4o Mini0,15-0,50 $0,60-2,00 $Classification, extraction
Classe Gemini Flash0,10-0,35 $0,40-1,50 $Résumé à fort volume
Classe Claude Haiku0,25-0,80 $1,25-4,00 $Sortie structurée rapide
Classe GPT-4o2,50-5,00 $10-20 $Raisonnement complexe, code
Classe Claude Sonnet3,00-15,00 $15-75 $Analyse, contexte long
Classe o1 / raisonnement15-60 $60-240 $Logique multi-étapes, maths

L’écart de coût entre le niveau le moins cher et le plus cher couvre deux ordres de grandeur. Une application à 10 000 requêtes par jour avec un modèle de classe o1 coûte environ 60 à 240 $ par jour ; la même application avec GPT-4o Mini coûte 1,50 à 20 $ par jour. Les décisions de routage fondées sur la complexité de la tâche - utiliser un classificateur de requêtes pour diriger chaque appel vers le niveau de modèle adapté - peuvent réduire la dépense d’API totale de 60 à 80 % dans les pipelines à complexité mixte.


Fenêtre de contexte et compromis de coût

Les grandes fenêtres de contexte permettent d’inclure plus d’informations par requête, mais plus de jetons dans l’invite signifie un coût d’entrée plus élevé. Une fenêtre de 100 000 jetons ne vaut la peine que si le contexte supplémentaire améliore réellement la qualité de la réponse pour la tâche visée. Pour la plupart des applications de génération augmentée par récupération (RAG), 2 000 à 4 000 jetons de contexte récupéré produisent des résultats presque aussi bons que 20 000 jetons, pour un coût d’entrée 5 à 10 fois inférieur. Comparez toujours qualité et longueur de contexte avant de figer de grandes invites en production.

Note

Les fournisseurs proposent souvent un tarif réduit pour les **jetons d’invite mis en cache**, c’est-à-dire la partie de l’invite identique d’un appel à l’autre (invites système, exemples few-shot, consignes statiques). Le cache d’invite d’OpenAI réduit le coût de ces jetons d’entrée de 50 % ; celui d’Anthropic de 90 %. Pour une application dotée d’une grande invite système fixe, activer le cache d’invite peut réduire nettement les coûts d’entrée.

Stratégies pour réduire les coûts par requête

L’optimisation des coûts par requête repose sur deux leviers : réduire les jetons par requête et réduire le prix par jeton. Les stratégies ci-dessous agissent sur les deux et sont classées approximativement par effort de mise en œuvre croissant.

  • Compresser les données d’entrée avant injection - convertissez les payloads JSON, CSV ou YAML au format TOON avant de les inclure dans les invites. Le convertisseur JSON vers TOON réduit le nombre de jetons de 30 à 60 % sans perte d’information.
  • Utiliser le modèle le moins cher conforme aux exigences - testez chaque type de tâche sur des niveaux de modèles plus petits avant de supposer qu’il faut un modèle de pointe. Beaucoup de tâches d’extraction, de classification et de résumé fonctionnent bien avec GPT-4o Mini ou Gemini Flash.
  • Raccourcir et épurer les invites système - auditez votre invite système pour repérer les consignes redondantes, les exemples de formatage longs et les mises en garde répétées. Chaque jeton supprimé économise de l’argent sur tous les appels d’API.
  • Limiter la longueur de sortie avec max_tokens - demandez des réponses concises et fixez un plafond strict de max_tokens. Les jetons de sortie coûtent 3 à 5 fois ceux d’entrée : réduire les réponses verbeuses coupe donc la part la plus chère de la facture.
  • Activer le cache d’invite - utilisez la mise en cache native du fournisseur pour les invites système statiques et les exemples few-shot. Les jetons mis en cache coûtent 50 à 90 % de moins que les autres chez OpenAI et Anthropic.
  • Mettre en cache les réponses fréquentes - pour les requêtes déterministes ou quasi déterministes, mettez la réponse du LLM en cache et servez-la pour les entrées identiques répétées sans appel d’API.

La compression de jetons : la voie la plus rapide vers l’économie

Pour les applications qui transmettent des données structurées aux LLM - catalogues produits, fiches utilisateurs, exports analytiques, réponses d’API -, la compression des jetons d’entrée offre la réduction de coût la plus rapide et la plus régulière. Convertir un payload JSON de 2 000 jetons au format TOON le ramène à environ 800-1 400 jetons. À 3,00 $/M de jetons d’entrée et 50 000 requêtes par jour, cette seule modification économise 0,09 à 0,18 $ par jour, soit environ 33 à 66 $ par mois sans impact sur la qualité. Pour les données CSV, le convertisseur CSV vers TOON atteint 40 à 60 % d’économie de jetons sur les jeux tabulaires, et le convertisseur YAML vers TOON traite la configuration et les données structurées au format YAML.

Tip

Validez les sorties du LLM avec le [validateur de garde-fous JSON pour sorties LLM](/tools/data/converters/llm-output-json-guardrail-validator) avant de déclencher des boucles de nouvelle tentative coûteuses. Un échec de sortie structurée qui oblige à reposer la question double le coût en jetons de cette requête. Détecter les erreurs d’analyse et les violations de type avant votre couche de validation élimine les jetons gaspillés en nouvelles tentatives.

Quand le coût par requête devient un problème

Pour un développeur solo ou un petit projet, les coûts de jetons restent rarement significatifs : 5 à 20 $ par mois pour l’expérimentation et le développement. Le problème apparaît quand une fonctionnalité monte en charge en production, quand les invites embarquent de gros payloads de contexte, ou quand un pipeline enchaîne plusieurs appels d’API par interaction utilisateur. Ce sont les scénarios où les calculs de coût par requête deviennent critiques.

Pipelines agentiques et multi-étapes

Les flux agentiques qui enchaînent plusieurs appels au LLM - planification, usage d’outils, réflexion, résumé - peuvent cumuler 10 000 à 100 000 jetons sur une seule requête utilisateur qui semble être une interaction unique. Chaque résultat d’outil et chaque tour de conversation est réinjecté comme contexte pour l’appel suivant, ce qui fait croître le nombre de jetons de façon quadratique avec le nombre d’étapes. Pour ces pipelines, l’estimation du coût par requête utilisateur suppose de multiplier le coût par requête par le nombre moyen d’appels LLM par exécution.

Applications RAG avec de gros extraits de documents

Les pipelines de génération augmentée par récupération injectent les extraits récupérés dans chaque invite. Si la stratégie de découpage produit de gros extraits (1 000 à 4 000 jetons chacun) et que trois à cinq extraits sont récupérés par requête, le nombre de jetons d’entrée peut atteindre 5 000 à 20 000 par appel avant même d’inclure la question de l’utilisateur. Compresser les extraits récupérés dans un format comme TOON - ou réduire leur taille dans le pipeline d’embeddings - abaisse directement le coût par requête sans changer la qualité de la récupération. Pour comprendre où se place la validation de sortie structurée dans ce type de pipeline, le guide Guardrails AI détaille la couche de validation en aval de la récupération.

Warning

Méfiez-vous des estimations de jetons issues d’outils de comptage de mots. Les ratios mots-jetons de l’anglais ne s’appliquent pas au code, au JSON, au SQL ou au XML : ces formats se tokenisent à 1 ou 2 jetons par mot au lieu du 1,3 habituel. Utilisez la bibliothèque `tiktoken` (pour les modèles OpenAI) ou l’API de comptage de jetons de votre fournisseur pour mesurer les vrais nombres de jetons sur des échantillons d’invites réelles, plutôt que d’estimer à partir du nombre de caractères.

Convertisseur CSV vers TOON

Convertissez vos jeux de données CSV au format compact TOON avec 40 à 60 % d’économie de jetons - le moyen le plus rapide de réduire le coût en jetons d’entrée des requêtes qui transmettent des données tabulaires aux API de LLM.

Open tool

Key takeaways

  • Un calculateur de coût par requête estime le coût d’un appel d’API LLM à partir des jetons d’entrée, des jetons de sortie et du modèle - indispensable pour budgéter avant de passer une fonctionnalité d’IA en production.
  • La tarification des LLM se répartit entre jetons d’entrée (votre invite et le contexte) et jetons de sortie (la réponse), ces derniers coûtant 3 à 5 fois plus cher car la génération est plus lourde en calcul.
  • Une requête à 0,012 $ devient 3 600 $ par mois à 10 000 appels quotidiens - modélisez toujours vos coûts au volume de production, pas par requête.
  • Choisir le niveau de modèle le moins cher conforme aux exigences de qualité est le premier levier de coût - les modèles de pointe coûtent 10 à 100 fois plus que les petits modèles sur des tâches que les deux savent traiter.
  • La compression de jetons - convertir des payloads JSON, CSV ou YAML au format TOON - réduit le nombre de jetons d’entrée de 30 à 60 % sans impact sur la qualité, avec le convertisseur JSON vers TOON ou le convertisseur CSV vers TOON.
  • Le cache d’invite (disponible chez OpenAI et Anthropic) réduit le coût des jetons d’entrée mis en cache de 50 à 90 % pour les invites système statiques - activez-le pour toute application en production dotée d’une grande invite système fixe.
  • Mesurez toujours l’usage réel des jetons via le champ `usage` des réponses d’API plutôt qu’en estimant à partir du nombre de mots - le code et le JSON se tokenisent bien moins efficacement que le texte anglais.

Questions fréquentes

Un calculateur de coût par requête est un outil qui estime le coût d’un appel d’API à un LLM en fonction du nombre de jetons d’entrée et de sortie de la requête. Vous saisissez la longueur de votre invite (jetons d’entrée), la longueur attendue de la réponse (jetons de sortie) et vous choisissez le modèle ; le calculateur multiplie chaque valeur par le tarif par jeton publié et renvoie un coût par requête. La plupart affichent aussi une projection mensuelle selon le volume attendu, ce qui est précieux pour budgéter avant de passer une fonction d’IA à l’échelle.

Le prix d’une API LLM repose sur les jetons : des fragments de texte qui correspondent à environ 0,75 mot en anglais. Les fournisseurs facturent séparément les jetons d’entrée (votre invite et le contexte) et ceux de sortie (la réponse du modèle). Les tarifs sont exprimés par million de jetons ($/M). Une requête avec une invite de 1 000 jetons et une réponse de 500 jetons, à 3,00 $/M en entrée et 15,00 $/M en sortie, coûte environ 0,003 $ + 0,0075 $ = 0,0105 $ par appel. Avec 10 000 requêtes par jour, cela représente 105 $ par jour.

Une invite simple d’une ligne avec une réponse courte utilise environ 50 à 200 jetons au total. Une invite avec un message système et un extrait de document pour du RAG utilise en général 1 000 à 4 000 jetons. Un flux agentique complexe avec résultats d’appels d’outils, historique de conversation et consignes de sortie structurée peut utiliser 8 000 à 32 000 jetons par requête. Les jetons de sortie représentent généralement 10 à 30 % du total pour la plupart des tâches de complétion, mais peuvent dominer pour le résumé, la génération de code ou la rédaction longue.

En 2026, les options les moins chères pour la plupart des tâches sont les modèles Google Gemini Flash et OpenAI GPT-4o Mini, tous deux sous 0,50 $/M de jetons d’entrée, adaptés à la classification, à l’extraction et à la complétion simple. Pour les tâches à forte composante de raisonnement exigeant une qualité de niveau GPT-4, les coûts grimpent à 2-15 $/M de jetons d’entrée. Choisir le bon niveau de modèle pour la tâche est le levier le plus efficace : utiliser un modèle de pointe là où un modèle plus petit suffit gaspille 5 à 10 fois le budget.

Les stratégies les plus efficaces sont : choisir le modèle le moins cher qui respecte les exigences de qualité ; compresser les données d’entrée pour réduire le nombre de jetons (convertir du JSON ou du CSV en format TOON économise 30 à 60 % de jetons) ; mettre en cache les réponses des requêtes répétées ou quasi identiques ; raccourcir les invites système en supprimant les consignes redondantes ; limiter la longueur de sortie avec `max_tokens` ; et regrouper les requêtes peu urgentes sur des plages horaires creuses où certains fournisseurs proposent des tarifs réduits.

Réduire le nombre de jetons d’entrée par la compression de format - par exemple convertir de gros payloads JSON en TOON avant injection - abaisse directement le coût par requête sans compromis sur la qualité.

Les jetons d’entrée sont ceux de tout ce que vous envoyez au modèle : l’invite système, l’historique de conversation, le message de l’utilisateur, les extraits de documents récupérés, les schémas de fonctions et tout autre contexte. Les jetons de sortie sont ceux que le modèle génère dans sa réponse. Les jetons de sortie coûtent généralement 3 à 5 fois plus cher que les jetons d’entrée, car la génération est plus coûteuse en calcul que le traitement de l’entrée. Autrement dit, les réponses longues et verbeuses coûtent proportionnellement plus que les longues invites : d’où l’intérêt des limites `max_tokens` et des consignes de concision.

Les offres gratuites d’OpenAI, Anthropic, Google et d’autres couvrent en général un nombre limité de jetons ou d’appels par mois sans frais, au-delà desquels la facturation à l’usage s’applique. L’offre gratuite convient au développement et aux tests, mais reste insuffisante pour une charge de production avec des milliers de requêtes quotidiennes. Certains fournisseurs maintiennent indéfiniment une offre gratuite limitée en débit ; d’autres font expirer le crédit gratuit après 90 jours quel que soit l’usage. Vérifiez les conditions actuelles de chaque fournisseur, car elles évoluent souvent.

Oui, et les économies augmentent avec l’usage. Convertir un payload JSON de 2 000 jetons en format TOON le ramène à environ 800-1 400 jetons selon la structure des données. À 3,00 $/M de jetons d’entrée et 50 000 requêtes par jour, cette seule optimisation économise entre 0,09 $ et 0,18 $ par jour, soit environ 33 à 66 $ par mois pour une seule modification. Pour les pipelines qui transmettent de gros payloads de données structurées aux LLM, la compression de jetons est souvent la voie la plus rapide vers une réduction de coût significative sans changer de modèle ni de fournisseur.

ShareXLinkedIn