Aller au contenu
Aback Tools Logo

Calculateur de coûts d'hébergement LLM

Calculez le coût d'infrastructure pour auto-héberger un grand modèle de langage – gratuit et 100 % privé dans votre navigateur. Comparez les locations de GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS), l'inférence serverless managée (Together AI, Groq, Fireworks AI, DeepInfra) et le matériel on-prem pour les modèles open-weight populaires : Llama 3.1, Mistral, Qwen, DeepSeek et Gemma. Inclut la vérification de compatibilité VRAM, le dimensionnement selon la quantification, les estimations par requête et un tableau comparatif complet.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

Les trois façons d'héberger un LLM

L'auto-hébergement n'est pas une chose unique : vous pouvez louer des GPU à l'heure, payer l'inférence managée au token ou acheter du matériel. Chaque modèle de coût gagne dans un scénario différent.

Le choix dépend surtout de la régularité de votre charge : un GPU loué coûte le même prix qu'il soit utilisé ou non.

  • Location de GPU : tarif horaire fixe, c'est vous qui gérez le stack.
  • Inférence managée : paiement au token, pas de coût d'inactivité.
  • Matériel on-prem : investissement initial, coût horaire plus faible à long terme.

VRAM et quantification

Avant de comparer les prix, vérifiez que le modèle tient sur le GPU envisagé. La quantification est le levier le plus direct pour réduire la VRAM nécessaire.

  • FP16/BF16 : 2 octets par paramètre.
  • INT8 : moitié moins de VRAM, perte de qualité minime.
  • INT4 : un quart de VRAM, avec 1-5 % de qualité en moins selon le benchmark.

Utilisation et coût par requête

Le prix horaire n'est que la moitié de l'histoire. L'utilisation réelle détermine la part de ce tarif qui devient du travail utile.

  1. Estimez vos tokens quotidiens et vos requêtes par minute en heure de pointe.
  2. Calculez l'utilisation attendue selon votre profil de trafic.
  3. Divisez le coût horaire par les requêtes réellement servies.
  4. Comparez ce coût par requête à celui d'une API managée.

Foire aux questions

Il estime les dépenses d'infrastructure pour exécuter vous-même un grand modèle de langage : sur des GPU cloud loués, des API d'inférence serverless managée ou du matériel on-prem. Il aide développeurs et équipes à comparer les options de déploiement, calculer les coûts par requête et mensuels, vérifier les besoins en VRAM et décider si l'auto-hébergement est plus économique que les API managées. Notre calculateur fonctionne 100 % dans votre navigateur, sans inscription.

Le seuil de rentabilité dépend de votre volume de requêtes et du modèle choisi. À faible volume (moins de 500 000 tokens/jour), les API managées sont généralement moins chères car vous évitez les coûts de GPU inactif. À fort volume (plus de 5 M tokens/jour), la location de GPU dédié ou le matériel on-prem coûte typiquement 60-90 % de moins par token que les API managées pour des modèles open-weight équivalents.

Llama 3.1 70B nécessite environ 140 Go de VRAM en FP16/BF16 (2× A100 80 Go), ~72 Go en INT8 (1× H100 80 Go) et ~40 Go en quantification INT4 (1× A100 80 Go). Notre calculateur affiche automatiquement les besoins en VRAM lorsque vous choisissez un modèle et un niveau de quantification, et signale les options de déploiement compatibles.

C'est le pourcentage de temps où le GPU traite réellement des requêtes d'inférence pendant les heures actives. Une faible utilisation (20-30 %) signifie que vous payez du calcul inactif, ce qui augmente votre coût effectif par requête. Une utilisation élevée (70-90 %) amortit mieux le tarif horaire sur plus de requêtes. Les serveurs d'inférence en production avec batching continu (vLLM, TGI) atteignent souvent 50-80 % sous charge constante.

La location de GPU cloud (RunPod, Vast.ai, Lambda Labs, AWS) vous donne un GPU dédié à tarif horaire fixe : vous installez et gérez votre propre stack de service. L'inférence managée (Together AI, Groq, Fireworks AI) gère toute l'infrastructure et facture au token consommé, sans coûts d'inactivité. La location de GPU convient aux charges élevées et constantes ; l'inférence managée aux usages imprévisibles ou à faible volume.

La quantification réduit la précision des poids de FP16 (2 octets/paramètre) à INT8 (1 octet) ou INT4 (0,5 octet), ce qui diminue les besoins en VRAM de 50-75 %. Vous pouvez ainsi exécuter un modèle 70B sur du matériel moins cher ou faire tenir un modèle plus grand sur le même GPU. La quantification INT4 (GGUF Q4, AWQ, GPTQ) réduit la qualité de 1-5 % sur la plupart des benchmarks – acceptable pour de nombreux cas de production.

Elles reposent sur les chiffres de benchmark publiés pour chaque modèle sur matériel H100 SXM, mis à l'échelle par nombre de GPU et utilisation. Le débit réel dépend de votre framework de service (vLLM, TGI, Ollama), de la taille de lot, de la longueur de contexte et de la configuration matérielle. Considérez-les comme des ordres de grandeur pour la planification de capacité.

Oui. Le calculateur fonctionne entièrement dans votre navigateur en JavaScript côté client. Choix de modèles, volumes d'usage, coûts d'infrastructure et résultats calculés sont traités localement sur votre appareil et ne sont jamais transmis à un serveur. Aucun compte requis, aucune donnée stockée. Votre planification d'infrastructure reste totalement privée et sécurisée.