Aller au contenu
Aback Tools Logo

Calculateur de coûts d'IA auto-hébergée

Comparez le coût réel d'auto-héberger des LLM open source face aux fournisseurs d'API managées - gratuit et 100 % privé dans votre navigateur. Configurez votre charge de travail, choisissez une option d'infrastructure GPU (RunPod, Vast.ai, Lambda, AWS, GCP, on-prem), ajoutez le surcoût DevOps et obtenez une comparaison mensuelle côte à côte, un coût par million de tokens, une vérification de capacité de débit et une période de rentabilité on-prem.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Le coût réel dépasse le prix du GPU

La location horaire n'est que le poste le plus visible. Temps d'ingénierie, réseau et stockage ajoutent souvent 30 à 60 % au coût brut.

Comparer uniquement le tarif GPU au prix par token d'une API mène à des conclusions erronées.

  • GPU : tarif horaire × heures du mois.
  • DevOps : heures d'ingénierie × coût horaire chargé.
  • Extras : réseau, stockage et mise en place du framework.

Utilisation et quantification

Le coût effectif par token dépend autant de l'utilisation que du prix horaire. Un GPU à moitié vide double votre coût unitaire.

  • Faible utilisation = coût par token proportionnellement plus élevé.
  • Batching et vLLM améliorent l'utilisation en production.
  • INT4/Q4 réduit la VRAM et permet de plus grands modèles sur GPU moins chers.

Quand chaque option gagne

Le cloud gagne pour des charges variables ou un projet court. Le matériel on-prem gagne avec un usage élevé et constant pendant des années.

  1. Estimez vos tokens quotidiens et votre utilisation soutenable.
  2. Calculez le coût mensuel auto-hébergé avec GPU et DevOps.
  3. Comparez au tarif d'une API managée pour la même charge.
  4. Si l'usage est stable et élevé, calculez l'amortissement on-prem sur 3-4 ans.

Foire aux questions

Il estime le coût mensuel total d'exploitation de LLM open source sur votre propre infrastructure GPU - location GPU ou coût amorti du matériel, main-d'œuvre DevOps et surcoût opérationnel - puis le compare aux tarifs d'une API managée pour la même charge de travail.

Le seuil dépend du modèle, de l'efficacité GPU et du surcoût d'exploitation. Pour des petits modèles comme Llama 3.1 8B, l'auto-hébergement devient compétitif vers 500 000 à 2 millions de tokens/jour. Pour des modèles 70B, le seuil est généralement de 5 à 20 millions de tokens/jour.

Le tarif horaire du GPU n'est qu'une partie du coût réel. Le temps d'ingénierie DevOps (500-3 000 $/mois), le réseau, le stockage et la mise en place du framework de serving ajoutent 30-60 % au coût brut du GPU. Incluez-les toujours face aux tarifs API.

C'est le pourcentage de calcul GPU traitant activement des requêtes. À 30 % d'utilisation, votre coût effectif par token est 3× plus élevé qu'à 90 %. Le batching des requêtes et des frameworks comme vLLM sont essentiels pour atteindre une utilisation élevée et rendre l'auto-hébergement compétitif.

La quantification (INT4/Q4) réduit les besoins en VRAM d'environ 70 %, permettant de plus grands modèles sur des GPU moins chers. En contrepartie : 10-20 % de débit en moins et une légère dégradation de la qualité. Pour la plupart des charges d'inférence en production, c'est un bon compromis quand la VRAM est le goulot d'étranglement.

Pour un déploiement cloud simple à modèle unique, prévoyez 5-20 heures/mois d'ingénieur. À 80-150 $/h en coût chargé, cela fait 400-3 000 $/mois. Partez de 10-20 heures/mois et suivez le temps réel sur le premier trimestre pour affiner votre projection.

Oui. Ce calculateur fonctionne entièrement dans votre navigateur. Volumes de charge, choix d'infrastructure et résultats sont traités localement sur votre appareil et jamais envoyés à un serveur, stockés ni partagés. Aucune connexion requise.

Pour les petits modèles à bas coût : Vast.ai (~0,35 $/h RTX 4090) et RunPod (~0,44 $/h L4). Pour l'inférence 7-13B en production : RunPod ou Lambda (A10G/A100 à 0,76-1,64 $/h). Pour les modèles 70B+ : RunPod H100 (3,49 $/h). Pour des charges stables:le matériel on-prem amorti sur 3-4 ans.