Calculateur de coûts d'IA auto-hébergée
Comparez le coût réel d'auto-héberger des LLM open source face aux fournisseurs d'API managées - gratuit et 100 % privé dans votre navigateur. Configurez votre charge de travail, choisissez une option d'infrastructure GPU (RunPod, Vast.ai, Lambda, AWS, GCP, on-prem), ajoutez le surcoût DevOps et obtenez une comparaison mensuelle côte à côte, un coût par million de tokens, une vérification de capacité de débit et une période de rentabilité on-prem.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
Le coût réel dépasse le prix du GPU
La location horaire n'est que le poste le plus visible. Temps d'ingénierie, réseau et stockage ajoutent souvent 30 à 60 % au coût brut.
Comparer uniquement le tarif GPU au prix par token d'une API mène à des conclusions erronées.
- GPU : tarif horaire × heures du mois.
- DevOps : heures d'ingénierie × coût horaire chargé.
- Extras : réseau, stockage et mise en place du framework.
Utilisation et quantification
Le coût effectif par token dépend autant de l'utilisation que du prix horaire. Un GPU à moitié vide double votre coût unitaire.
- Faible utilisation = coût par token proportionnellement plus élevé.
- Batching et vLLM améliorent l'utilisation en production.
- INT4/Q4 réduit la VRAM et permet de plus grands modèles sur GPU moins chers.
Quand chaque option gagne
Le cloud gagne pour des charges variables ou un projet court. Le matériel on-prem gagne avec un usage élevé et constant pendant des années.
- Estimez vos tokens quotidiens et votre utilisation soutenable.
- Calculez le coût mensuel auto-hébergé avec GPU et DevOps.
- Comparez au tarif d'une API managée pour la même charge.
- Si l'usage est stable et élevé, calculez l'amortissement on-prem sur 3-4 ans.
Foire aux questions
Il estime le coût mensuel total d'exploitation de LLM open source sur votre propre infrastructure GPU - location GPU ou coût amorti du matériel, main-d'œuvre DevOps et surcoût opérationnel - puis le compare aux tarifs d'une API managée pour la même charge de travail.
Le seuil dépend du modèle, de l'efficacité GPU et du surcoût d'exploitation. Pour des petits modèles comme Llama 3.1 8B, l'auto-hébergement devient compétitif vers 500 000 à 2 millions de tokens/jour. Pour des modèles 70B, le seuil est généralement de 5 à 20 millions de tokens/jour.
Le tarif horaire du GPU n'est qu'une partie du coût réel. Le temps d'ingénierie DevOps (500-3 000 $/mois), le réseau, le stockage et la mise en place du framework de serving ajoutent 30-60 % au coût brut du GPU. Incluez-les toujours face aux tarifs API.
C'est le pourcentage de calcul GPU traitant activement des requêtes. À 30 % d'utilisation, votre coût effectif par token est 3× plus élevé qu'à 90 %. Le batching des requêtes et des frameworks comme vLLM sont essentiels pour atteindre une utilisation élevée et rendre l'auto-hébergement compétitif.
La quantification (INT4/Q4) réduit les besoins en VRAM d'environ 70 %, permettant de plus grands modèles sur des GPU moins chers. En contrepartie : 10-20 % de débit en moins et une légère dégradation de la qualité. Pour la plupart des charges d'inférence en production, c'est un bon compromis quand la VRAM est le goulot d'étranglement.
Pour un déploiement cloud simple à modèle unique, prévoyez 5-20 heures/mois d'ingénieur. À 80-150 $/h en coût chargé, cela fait 400-3 000 $/mois. Partez de 10-20 heures/mois et suivez le temps réel sur le premier trimestre pour affiner votre projection.
Oui. Ce calculateur fonctionne entièrement dans votre navigateur. Volumes de charge, choix d'infrastructure et résultats sont traités localement sur votre appareil et jamais envoyés à un serveur, stockés ni partagés. Aucune connexion requise.
Pour les petits modèles à bas coût : Vast.ai (~0,35 $/h RTX 4090) et RunPod (~0,44 $/h L4). Pour l'inférence 7-13B en production : RunPod ou Lambda (A10G/A100 à 0,76-1,64 $/h). Pour les modèles 70B+ : RunPod H100 (3,49 $/h). Pour des charges stables:le matériel on-prem amorti sur 3-4 ans.