Calculateur de coûts d'inférence
Estimez gratuitement en ligne les dépenses d'inférence LLM à partir des requêtes, de la latence et des volumes de tokens. Modélisez les remises de cache de prompts, les économies Batch API, la surcharge des reprises et la capacité de débit concurrent ; comparez ensuite coûts et latence sur 14 modèles. Fonctionne 100 % dans votre navigateur.
Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.
Real-time user-facing chat with sub-2s latency SLA
Token Sizes per Request
Request Volume & Latency
Cost Optimizations
Projected Monthly Inference Cost
Cost / Request
$0.000330
Cost / 1K Req
$0.3300
Est. Latency
3.8s
Max RPS
13.3
Per-Request Cost Breakdown
Model Cost & Latency Comparison
Sorted by lowest monthly cost| Model | $/req | Monthly Cost | Latency | SLA |
|---|---|---|---|---|
Llama 3.1 8BBudget Groq/Together · 600 tok/s · TTFT 80ms | $0.00006800 | $41.62 | 663ms | ✓ Met |
Mistral Small 3.2Budget Mistral · 160 tok/s · TTFT 160ms | $0.000185 | $113.22 | 2.3s | ✗ Breach |
GPT-4o miniBudget Selected OpenAI · 100 tok/s · TTFT 250ms | $0.000330 | $201.96 | 3.8s | ✗ Breach |
DeepSeek-V3Budget DeepSeek · 90 tok/s · TTFT 300ms | $0.000601 | $367.81 | 4.2s | ✗ Breach |
Llama 3.3 70BBudget Groq/Togther · 250 tok/s · TTFT 120ms | $0.000749 | $458.08 | 1.5s | ✗ Breach |
Gemini 2.5 FlashBudget Google · 150 tok/s · TTFT 180ms | $0.001115 | $682.38 | 2.5s | ✗ Breach |
Grok 4.3 xAI · 80 tok/s · TTFT 350ms | $0.001875 | $1,147.50 | 4.7s | ✗ Breach |
Claude 3.5 HaikuBudget Anthropic · 130 tok/s · TTFT 200ms | $0.002040 | $1,248.48 | 2.9s | ✗ Breach |
o4-mini OpenAI · 50 tok/s · TTFT 600ms | $0.002420 | $1,481.04 | 7.6s | ✗ Breach |
Mistral Large 3 Mistral · 70 tok/s · TTFT 380ms | $0.003700 | $2,264.40 | 5.4s | ✗ Breach |
o3Capable OpenAI · 45 tok/s · TTFT 700ms | $0.004400 | $2,692.80 | 8.5s | ✗ Breach |
Gemini 2.5 Pro Google · 65 tok/s · TTFT 450ms | $0.004500 | $2,754.00 | 5.8s | ✗ Breach |
GPT-4oCapable OpenAI · 60 tok/s · TTFT 400ms | $0.005500 | $3,366.00 | 6.2s | ✗ Breach |
Claude Sonnet 4.6Capable Anthropic · 55 tok/s · TTFT 500ms | $0.007650 | $4,681.80 | 6.9s | ✗ Breach |
Ce qui compose le coût d'inférence
Le coût d'inférence dépend du nombre de requêtes, de la taille d'entrée et de sortie de chacune et du modèle choisi. La combinaison de ces trois facteurs change complètement le résultat.
Les tokens de sortie coûtant plus cher que les tokens d'entrée, une réponse longue et un prompt court peuvent coûter plus que l'inverse.
- Requêtes quotidiennes × coût par requête = dépense de base quotidienne.
- Tokens de sortie plus chers : surveillez la longueur des réponses.
- La latence cible conditionne le modèle que vous pouvez vous permettre.
Remises de cache et par lots
Le cache de prompts et la Batch API sont les deux principaux leviers pour réduire la facture sans dégrader la qualité. Chacun correspond à des profils de trafic différents.
- Cache de prompts : utile avec un prompt système ou un contexte volumineux et répété.
- Batch API : environ 50 % de remise pour les traitements asynchrones.
- Reprises : s'ajoutent proportionnellement au volume et au coût total.
Vérifier le SLA de latence
Un coût faible ne sert à rien si l'expérience se dégrade. La latence estimée s'obtient à partir du TTFT plus le temps de génération des tokens de sortie.
- Définissez le TTFT et la vitesse de génération du modèle évalué.
- Calculez la latence de bout en bout avec votre taille de sortie typique.
- Comparez le résultat à votre objectif de SLA.
- En cas d'échec, passez à un modèle plus rapide ou réduisez la longueur de sortie.
Foire aux questions
Il estime ce que vous payez pour exécuter des requêtes LLM en direct à une échelle donnée. Il prend votre nombre de tokens d'entrée et de sortie, le volume quotidien de requêtes et le modèle choisi pour projeter le coût par requête et le total quotidien, mensuel ou annuel. Notre outil modélise aussi le respect du SLA de latence, la capacité de débit, le cache de prompts, les remises Batch API et la surcharge des reprises – localement dans votre navigateur, sans inscription.
Le coût d'entraînement est une dépense unique pour construire ou affiner un modèle sur du calcul GPU. Le coût d'inférence est la dépense récurrente par requête payée chaque fois qu'un utilisateur ou un pipeline envoie un prompt et reçoit une réponse. Dans la plupart des applications en production, l'inférence domine la dépense IA continue : elle évolue directement avec votre base d'utilisateurs et le volume de requêtes.
Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur en JavaScript. Tailles de tokens, volumes de requêtes, cibles de latence et projections de coûts sont traités localement sur votre appareil et ne sont jamais transmis à un serveur ni stockés. Vos données restent 100 % privées pendant toute la session.
La latence de bout en bout est estimée ainsi : temps jusqu'au premier token (TTFT) + (tokens de sortie ÷ vitesse de génération en tokens/s). Par exemple, un modèle avec 300 ms de TTFT générant 500 tokens à 100 tokens/s a une latence estimée de 300 ms + 5 000 ms = 5,3 s. Les valeurs de TTFT et de vitesse sont des médianes représentatives ; les valeurs réelles varient selon la région du fournisseur, la charge serveur et la taille de la requête.
Le TTFT est le délai entre l'envoi d'une requête et la réception du tout premier token de la réponse. Il détermine la vitesse à laquelle votre application peut commencer à afficher du contenu. Un TTFT faible (moins de 200 ms) est crucial pour les applications de chat interactives. Les modèles plus petits et plus quantifiés ont généralement un TTFT plus faible que les grands modèles de pointe.
Le cache de prompts stocke l'état d'attention KV d'un préfixe de prompt répété, de sorte que les requêtes suivantes utilisant le même préfixe sont facturées à environ 25 % du tarif d'entrée standard. C'est très efficace lorsque votre prompt système ou contexte documentaire est volumineux et partagé entre de nombreuses requêtes.
Utilisez la Batch API pour les charges insensibles à la latence : synthèse de documents en masse, enrichissement de données hors ligne, classification à grande échelle, génération de rapports nocturnes. La Batch API facture environ 50 % du tarif temps réel standard. L'inférence temps réel reste nécessaire pour toute fonctionnalité interactive côté utilisateur.
Un taux de 2-5 % est typique pour les charges API LLM en production, couvrant les erreurs de limite de débit, les délais d'attente transitoires et les erreurs 5xx du fournisseur. Les applications à haut débit appelant souvent près des limites peuvent connaître des taux de 5-15 %. Le taux de reprise s'ajoute proportionnellement à votre nombre total de requêtes et au coût.