Aller au contenu
Aback Tools Logo

Calculateur de coûts d'inférence

Estimez gratuitement en ligne les dépenses d'inférence LLM à partir des requêtes, de la latence et des volumes de tokens. Modélisez les remises de cache de prompts, les économies Batch API, la surcharge des reprises et la capacité de débit concurrent ; comparez ensuite coûts et latence sur 14 modèles. Fonctionne 100 % dans votre navigateur.

Inference Cost Calculator

Estimate LLM inference expenses from request volume, token sizes, latency SLA, and throughput. Model prompt caching discounts, batch API savings, retry overhead, and concurrent capacity - then compare costs across 14 major models. Runs 100% in your browser.

Real-time user-facing chat with sub-2s latency SLA

In/1M: $0.15Out/1M: $0.60TTFT: 250msSpeed: 100 tok/s

Token Sizes per Request

tokens
tokens
Total/req: 1,150 tokensIn cost: $0.000120Out cost: $0.000210

Request Volume & Latency

req/day
concurrent
ms

Cost Optimizations

%
%
%
⚠️ SLA Risk: Estimated P95 latency for GPT-4o mini is 3.8s - exceeds your 1.5s target. Consider a faster model or reduce output tokens.

Projected Monthly Inference Cost

$201.96for 612,000 requests

Cost / Request

$0.000330

Cost / 1K Req

$0.3300

Est. Latency

3.8s

Max RPS

13.3

Per-Request Cost Breakdown

Input (standard): $0.000120Input (cached): $0.00Output: $0.000210Retry overhead: $0.00000660

Model Cost & Latency Comparison

Sorted by lowest monthly cost
Model$/reqMonthly CostLatencySLA
Llama 3.1 8BBudget
Groq/Together · 600 tok/s · TTFT 80ms
$0.00006800$41.62663ms✓ Met
Mistral Small 3.2Budget
Mistral · 160 tok/s · TTFT 160ms
$0.000185$113.222.3s✗ Breach
GPT-4o miniBudget Selected
OpenAI · 100 tok/s · TTFT 250ms
$0.000330$201.963.8s✗ Breach
DeepSeek-V3Budget
DeepSeek · 90 tok/s · TTFT 300ms
$0.000601$367.814.2s✗ Breach
Llama 3.3 70BBudget
Groq/Togther · 250 tok/s · TTFT 120ms
$0.000749$458.081.5s✗ Breach
Gemini 2.5 FlashBudget
Google · 150 tok/s · TTFT 180ms
$0.001115$682.382.5s✗ Breach
Grok 4.3
xAI · 80 tok/s · TTFT 350ms
$0.001875$1,147.504.7s✗ Breach
Claude 3.5 HaikuBudget
Anthropic · 130 tok/s · TTFT 200ms
$0.002040$1,248.482.9s✗ Breach
o4-mini
OpenAI · 50 tok/s · TTFT 600ms
$0.002420$1,481.047.6s✗ Breach
Mistral Large 3
Mistral · 70 tok/s · TTFT 380ms
$0.003700$2,264.405.4s✗ Breach
o3Capable
OpenAI · 45 tok/s · TTFT 700ms
$0.004400$2,692.808.5s✗ Breach
Gemini 2.5 Pro
Google · 65 tok/s · TTFT 450ms
$0.004500$2,754.005.8s✗ Breach
GPT-4oCapable
OpenAI · 60 tok/s · TTFT 400ms
$0.005500$3,366.006.2s✗ Breach
Claude Sonnet 4.6Capable
Anthropic · 55 tok/s · TTFT 500ms
$0.007650$4,681.806.9s✗ Breach
Disclaimer:Pricing uses standard Pay-As-You-Go rates. Latency estimates are indicative medians - actual TTFT and throughput vary by region, load, and request size. Batch API discounts are typically ~50% but differ by provider. Always verify rates on each provider's official pricing page. All calculations run locally in your browser; no data is sent to any server.

Ce qui compose le coût d'inférence

Le coût d'inférence dépend du nombre de requêtes, de la taille d'entrée et de sortie de chacune et du modèle choisi. La combinaison de ces trois facteurs change complètement le résultat.

Les tokens de sortie coûtant plus cher que les tokens d'entrée, une réponse longue et un prompt court peuvent coûter plus que l'inverse.

  • Requêtes quotidiennes × coût par requête = dépense de base quotidienne.
  • Tokens de sortie plus chers : surveillez la longueur des réponses.
  • La latence cible conditionne le modèle que vous pouvez vous permettre.

Remises de cache et par lots

Le cache de prompts et la Batch API sont les deux principaux leviers pour réduire la facture sans dégrader la qualité. Chacun correspond à des profils de trafic différents.

  • Cache de prompts : utile avec un prompt système ou un contexte volumineux et répété.
  • Batch API : environ 50 % de remise pour les traitements asynchrones.
  • Reprises : s'ajoutent proportionnellement au volume et au coût total.

Vérifier le SLA de latence

Un coût faible ne sert à rien si l'expérience se dégrade. La latence estimée s'obtient à partir du TTFT plus le temps de génération des tokens de sortie.

  1. Définissez le TTFT et la vitesse de génération du modèle évalué.
  2. Calculez la latence de bout en bout avec votre taille de sortie typique.
  3. Comparez le résultat à votre objectif de SLA.
  4. En cas d'échec, passez à un modèle plus rapide ou réduisez la longueur de sortie.

Foire aux questions

Il estime ce que vous payez pour exécuter des requêtes LLM en direct à une échelle donnée. Il prend votre nombre de tokens d'entrée et de sortie, le volume quotidien de requêtes et le modèle choisi pour projeter le coût par requête et le total quotidien, mensuel ou annuel. Notre outil modélise aussi le respect du SLA de latence, la capacité de débit, le cache de prompts, les remises Batch API et la surcharge des reprises – localement dans votre navigateur, sans inscription.

Le coût d'entraînement est une dépense unique pour construire ou affiner un modèle sur du calcul GPU. Le coût d'inférence est la dépense récurrente par requête payée chaque fois qu'un utilisateur ou un pipeline envoie un prompt et reçoit une réponse. Dans la plupart des applications en production, l'inférence domine la dépense IA continue : elle évolue directement avec votre base d'utilisateurs et le volume de requêtes.

Oui. Le calculateur fonctionne entièrement côté client dans votre navigateur en JavaScript. Tailles de tokens, volumes de requêtes, cibles de latence et projections de coûts sont traités localement sur votre appareil et ne sont jamais transmis à un serveur ni stockés. Vos données restent 100 % privées pendant toute la session.

La latence de bout en bout est estimée ainsi : temps jusqu'au premier token (TTFT) + (tokens de sortie ÷ vitesse de génération en tokens/s). Par exemple, un modèle avec 300 ms de TTFT générant 500 tokens à 100 tokens/s a une latence estimée de 300 ms + 5 000 ms = 5,3 s. Les valeurs de TTFT et de vitesse sont des médianes représentatives ; les valeurs réelles varient selon la région du fournisseur, la charge serveur et la taille de la requête.

Le TTFT est le délai entre l'envoi d'une requête et la réception du tout premier token de la réponse. Il détermine la vitesse à laquelle votre application peut commencer à afficher du contenu. Un TTFT faible (moins de 200 ms) est crucial pour les applications de chat interactives. Les modèles plus petits et plus quantifiés ont généralement un TTFT plus faible que les grands modèles de pointe.

Le cache de prompts stocke l'état d'attention KV d'un préfixe de prompt répété, de sorte que les requêtes suivantes utilisant le même préfixe sont facturées à environ 25 % du tarif d'entrée standard. C'est très efficace lorsque votre prompt système ou contexte documentaire est volumineux et partagé entre de nombreuses requêtes.

Utilisez la Batch API pour les charges insensibles à la latence : synthèse de documents en masse, enrichissement de données hors ligne, classification à grande échelle, génération de rapports nocturnes. La Batch API facture environ 50 % du tarif temps réel standard. L'inférence temps réel reste nécessaire pour toute fonctionnalité interactive côté utilisateur.

Un taux de 2-5 % est typique pour les charges API LLM en production, couvrant les erreurs de limite de débit, les délais d'attente transitoires et les erreurs 5xx du fournisseur. Les applications à haut débit appelant souvent près des limites peuvent connaître des taux de 5-15 %. Le taux de reprise s'ajoute proportionnellement à votre nombre total de requêtes et au coût.