Calculateur de coûts d'hébergement LLM
Calculez le coût d'infrastructure pour auto-héberger un grand modèle de langage – gratuit et 100 % privé dans votre navigateur. Comparez les locations de GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS), l'inférence serverless managée (Together AI, Groq, Fireworks AI, DeepInfra) et le matériel on-prem pour les modèles open-weight populaires : Llama 3.1, Mistral, Qwen, DeepSeek et Gemma. Inclut la vérification de compatibilité VRAM, le dimensionnement selon la quantification, les estimations par requête et un tableau comparatif complet.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
Les trois façons d'héberger un LLM
L'auto-hébergement n'est pas une chose unique : vous pouvez louer des GPU à l'heure, payer l'inférence managée au token ou acheter du matériel. Chaque modèle de coût gagne dans un scénario différent.
Le choix dépend surtout de la régularité de votre charge : un GPU loué coûte le même prix qu'il soit utilisé ou non.
- Location de GPU : tarif horaire fixe, c'est vous qui gérez le stack.
- Inférence managée : paiement au token, pas de coût d'inactivité.
- Matériel on-prem : investissement initial, coût horaire plus faible à long terme.
VRAM et quantification
Avant de comparer les prix, vérifiez que le modèle tient sur le GPU envisagé. La quantification est le levier le plus direct pour réduire la VRAM nécessaire.
- FP16/BF16 : 2 octets par paramètre.
- INT8 : moitié moins de VRAM, perte de qualité minime.
- INT4 : un quart de VRAM, avec 1-5 % de qualité en moins selon le benchmark.
Utilisation et coût par requête
Le prix horaire n'est que la moitié de l'histoire. L'utilisation réelle détermine la part de ce tarif qui devient du travail utile.
- Estimez vos tokens quotidiens et vos requêtes par minute en heure de pointe.
- Calculez l'utilisation attendue selon votre profil de trafic.
- Divisez le coût horaire par les requêtes réellement servies.
- Comparez ce coût par requête à celui d'une API managée.
Foire aux questions
Il estime les dépenses d'infrastructure pour exécuter vous-même un grand modèle de langage : sur des GPU cloud loués, des API d'inférence serverless managée ou du matériel on-prem. Il aide développeurs et équipes à comparer les options de déploiement, calculer les coûts par requête et mensuels, vérifier les besoins en VRAM et décider si l'auto-hébergement est plus économique que les API managées. Notre calculateur fonctionne 100 % dans votre navigateur, sans inscription.
Le seuil de rentabilité dépend de votre volume de requêtes et du modèle choisi. À faible volume (moins de 500 000 tokens/jour), les API managées sont généralement moins chères car vous évitez les coûts de GPU inactif. À fort volume (plus de 5 M tokens/jour), la location de GPU dédié ou le matériel on-prem coûte typiquement 60-90 % de moins par token que les API managées pour des modèles open-weight équivalents.
Llama 3.1 70B nécessite environ 140 Go de VRAM en FP16/BF16 (2× A100 80 Go), ~72 Go en INT8 (1× H100 80 Go) et ~40 Go en quantification INT4 (1× A100 80 Go). Notre calculateur affiche automatiquement les besoins en VRAM lorsque vous choisissez un modèle et un niveau de quantification, et signale les options de déploiement compatibles.
C'est le pourcentage de temps où le GPU traite réellement des requêtes d'inférence pendant les heures actives. Une faible utilisation (20-30 %) signifie que vous payez du calcul inactif, ce qui augmente votre coût effectif par requête. Une utilisation élevée (70-90 %) amortit mieux le tarif horaire sur plus de requêtes. Les serveurs d'inférence en production avec batching continu (vLLM, TGI) atteignent souvent 50-80 % sous charge constante.
La location de GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS) vous donne un GPU dédié à tarif horaire fixe : vous installez et gérez votre propre stack de service. L'inférence managée (Together AI, Groq, Fireworks AI) gère toute l'infrastructure et facture au token consommé, sans coûts d'inactivité. La location de GPU convient aux charges élevées et constantes ; l'inférence managée aux usages imprévisibles ou à faible volume.
La quantification réduit la précision des poids de FP16 (2 octets/paramètre) à INT8 (1 octet) ou INT4 (0,5 octet), ce qui diminue les besoins en VRAM de 50-75 %. Vous pouvez ainsi exécuter un modèle 70B sur du matériel moins cher ou faire tenir un modèle plus grand sur le même GPU. La quantification INT4 (GGUF Q4, AWQ, GPTQ) réduit la qualité de 1-5 % sur la plupart des benchmarks – acceptable pour de nombreux cas de production.
Elles reposent sur les chiffres de benchmark publiés pour chaque modèle sur matériel H100 SXM, mis à l'échelle par nombre de GPU et utilisation. Le débit réel dépend de votre framework de service (vLLM, TGI, Ollama), de la taille de lot, de la longueur de contexte et de la configuration matérielle. Considérez-les comme des ordres de grandeur pour la planification de capacité.
Oui. Le calculateur fonctionne entièrement dans votre navigateur en JavaScript côté client. Choix de modèles, volumes d'usage, coûts d'infrastructure et résultats calculés sont traités localement sur votre appareil et ne sont jamais transmis à un serveur. Aucun compte requis, aucune donnée stockée. Votre planification d'infrastructure reste totalement privée et sécurisée.