Calculateur de coût de prompt
Estimez gratuitement en ligne le coût d'exécution de prompts à grande échelle. Définissez votre prompt système, votre message utilisateur et vos tailles de tokens de sortie, puis réglez votre volume quotidien de requêtes pour voir les coûts API projetés par jour, par mois et par an. Comparez instantanément les coûts sur 13 grands fournisseurs de LLM. Rapide, privé et 100 % dans le navigateur.
Estimate the cost of running prompts at scale. Define your system prompt, user message, and output size - then set your request volume to see daily, monthly, and yearly API cost projections across all major models.
Support chatbot with system prompt + short user messages
Prompt Composition (per request)
Token Breakdown per Request
Scale & Model
Projected Monthly Cost - GPT-4o mini
Cost / Request
$0.000322
Cost / Day
$1.61
Input Token Cost
$21.38
Output Token Cost
$27.00
Cost at Scale - All Periods
| Period | Total Requests | Input Cost | Output Cost | Total Cost |
|---|---|---|---|---|
| Daily | 5,000 | $0.7125 | $0.9000 | $1.61 |
| MonthlySelected | 150,000 | $21.38 | $27.00 | $48.38 |
| Yearly | 1,825,000 | $260.06 | $328.50 | $588.56 |
Cross-Model Price Comparison
Sorted by lowest monthly cost| Model | In/1M | Out/1M | Cost/Req | Monthly Total |
|---|---|---|---|---|
Mistral Small(Mistral)Budget | $0.10 | $0.30 | $0.000185 | $27.75 |
GPT-4o mini(OpenAI)Budget Active | $0.15 | $0.60 | $0.000322 | $48.37 |
DeepSeek-V3(DeepSeek)Budget | $0.27 | $1.10 | $0.000586 | $87.98 |
Gemini 2.5 Flash(Google)Budget | $0.30 | $2.50 | $0.001035 | $155.25 |
Grok 4.3(xAI) | $1.25 | $2.50 | $0.001937 | $290.63 |
Claude 3.5 Haiku(Anthropic)Budget | $0.80 | $4.00 | $0.001960 | $294.00 |
o4-mini(OpenAI)Budget | $1.10 | $4.40 | $0.002365 | $354.75 |
Mistral Large(Mistral) | $2.00 | $6.00 | $0.003700 | $555.00 |
Gemini 2.5 Pro(Google) | $1.25 | $10.00 | $0.004187 | $628.12 |
o3(OpenAI) | $2.00 | $8.00 | $0.004300 | $645.00 |
GPT-4o(OpenAI) | $2.50 | $10.00 | $0.005375 | $806.25 |
Claude Sonnet 4.6(Anthropic)Powerful | $3.00 | $15.00 | $0.007350 | $1,102.50 |
Claude 3 Opus(Anthropic)Powerful | $15.00 | $75.00 | $0.0367 | $5,512.50 |
Click any row to select that model.
Pourquoi le prompt système domine la facture
Le prompt système est envoyé en entier à chaque requête. Son coût ne dépend pas de son utilité mais du nombre de requêtes effectuées.
À fort volume, retirer quelques centaines de tokens du prompt système représente une économie mensuelle très significative.
- Coût du prompt système = tokens × requêtes par jour × jours.
- Les tokens de sortie coûtent 3-6× plus cher que les tokens d'entrée.
- Le cache de prompts réduit ce coût de 75-90 % lorsqu'il s'applique.
Répartir message utilisateur et contexte
Séparez ce qui est contexte fixe de ce qui change à chaque requête. Seule la partie fixe est éligible au cache.
- Comptez séparément les tokens du prompt système et du message utilisateur.
- Additionnez les tokens d'entrée prévus par requête.
- Ajoutez les tokens de sortie attendus par réponse.
- Multipliez par votre volume de requêtes pour obtenir le total de la période.
Choisir le modèle et projeter la croissance
Comparez le coût total de votre configuration exacte entre les modèles avant de vous engager. Le modèle le moins cher qui respecte vos exigences de qualité est presque toujours le meilleur choix.
- Commencez par le modèle le plus économique et montez seulement si la qualité manque.
- Modélisez la croissance mensuelle pour ne pas sous-budgéter.
- Réservez les modèles de pointe au raisonnement complexe.
Foire aux questions
Il estime la dépense API liée à l'exécution d'une configuration de prompt donnée - prompt système, message utilisateur et sortie attendue - pour un volume de requêtes et une période donnés. Il aide les développeurs et équipes produit à connaître leurs coûts API LLM avant la mise en production, à planifier les paliers tarifaires d'un SaaS IA et à comparer quel modèle offre le meilleur rapport coût/qualité.
Règle approximative : 1 token ≈ 4 caractères, soit environ 0,75 mot en anglais. Un prompt système de 500 mots fait environ 650-700 tokens. Un court message utilisateur de 50 mots tourne autour de 65-70 tokens. Pour des comptages précis, utilisez un tokenizer : Tiktoken d'OpenAI et le tokenizer Claude d'Anthropic sont disponibles en open source. Notre outil Token Counter peut aussi estimer les tokens à partir d'un texte collé.
Le prompt système est facturé en totalité à chaque requête API. S'il fait 1 000 tokens et que vous faites 10 000 requêtes par jour, cela représente 10 millions de tokens d'entrée rien que pour le prompt système, chaque jour. C'est pourquoi les prompts système longs gonflent fortement les coûts. Réduire le prompt système et activer le cache de prompts sont les deux optimisations au meilleur ROI pour la plupart des applications LLM en production.
Non - le calculateur utilise les tarifs standard à l'usage sans cache. Cela vous donne volontairement le coût de base du pire cas. En pratique, des fournisseurs comme OpenAI, Anthropic, Google et xAI proposent un cache de prompts qui réduit les coûts des tokens d'entrée de 75-90 % pour le contenu statique répété. Utilisez cet outil pour établir votre base, puis modélisez les économies de cache séparément.
Utilisez le tableau de comparaison entre modèles : il indique le coût total pour votre configuration exacte sur tous les modèles pris en charge. Commencez par le modèle le moins cher qui atteint votre niveau de qualité. Les tâches de classification, extraction et sortie structurée fonctionnent très bien sur des modèles plus petits (GPT-4o mini, Claude 3.5 Haiku, Gemini Flash, Mistral Small). Réservez les modèles de pointe coûteux au raisonnement profond.
Le champ de croissance mensuelle modélise l'augmentation du volume de requêtes sur la période de prévision. Si vous saisissez 20 %, le calculateur suppose que votre nombre de requêtes quotidiennes croît de 20 % chaque mois. Pour une prévision annuelle, il interpole linéairement entre le volume initial et le volume final projeté pour calculer le total des requêtes et le coût total. Mettez 0 pour une projection constante.
Générer des tokens impose au modèle une passe forward autorégressive complète pour chaque token - bien plus de calcul que la lecture des tokens d'entrée. La génération de sortie est donc plus coûteuse et facturée avec une prime de 3-6× sur les tokens d'entrée chez la plupart des fournisseurs. C'est pourquoi les applications à réponses longues ont un profil de coût différent des classificateurs à sortie courte.
Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur. Aucun décompte de tokens, configuration de prompt, estimation de coût ou choix de modèle n'est envoyé à un serveur. Tout est calculé localement sur votre appareil et jamais stocké. Vos données de planification sont 100 % privées et sécurisées.