LLM-Hosting-Kostenrechner
Berechnen Sie die Infrastrukturkosten für das Selbst-Hosting eines großen Sprachmodells – kostenlos und 100 % privat im Browser. Vergleichen Sie Cloud-GPU-Mieten (RunPod, Vast.ai, Lambda Labs, AWS), Managed Serverless Inference (Together AI, Groq, Fireworks AI, DeepInfra) und On-Prem-Hardware für gängige Open-Weight-Modelle wie Llama 3.1, Mistral, Qwen, DeepSeek und Gemma. Inklusive VRAM-Kompatibilitätsprüfung, quantisierungsbewusster Dimensionierung, Kosten pro Anfrage und vollständiger Vergleichstabelle.
Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.
Model to Host
Strong open-source frontier model
Deployment Option
Cloud GPU (Self-Managed)
Managed Inference (Serverless)
On-Premises Hardware
Usage & Scale
RunPod - A100 80GB
Monthly Cost
$787.20
Annual Cost
$9,577.60
Cost / Request
$0.0052
Cost / 1K Tokens
$0.0028
Monthly Cost Breakdown
All Options - Monthly Estimate
Sorted by cost| Option | Type | Monthly | Fits Model |
|---|---|---|---|
Groq - Llama 3.1 70B | Managed | $180.15 | ✓ Serverless |
DeepInfra - Llama 3.1 70B | Managed | $185.25 | ✓ Serverless |
Together AI - Llama 3.1 70B | Managed | $250.80 | ✓ Serverless |
Fireworks AI - Llama 3.1 70B | Managed | $256.50 | ✓ Serverless |
Vast.ai - A100 80GB | Cloud GPU | $672.00 | ✓ 80 GB VRAM |
RunPod - A100 80GB Selected | Cloud GPU | $787.20 | ✓ 80 GB VRAM |
On-Prem - A100 80GB Server | On-Prem | $850.00 | ✓ 80 GB VRAM |
RunPod - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
Lambda Labs - H100 SXM | Cloud GPU | $1,675.20 | ✓ 80 GB VRAM |
On-Prem - 8× A100 DGX | On-Prem | $5,833.33 | ✓ 5120 GB VRAM |
AWS p4d.24xlarge - 8× A100 | Cloud GPU | $15,732.48 | ✓ 320 GB VRAM |
On-Prem - RTX 4090 (×1) | On-Prem | - | ✗ 72GB needed |
Vast.ai - RTX 4090 | Cloud GPU | - | ✗ 72GB needed |
AWS g5.xlarge - A10G | Cloud GPU | - | ✗ 72GB needed |
Throughput Estimate
Tokens / Sec
132
Tokens / Day
7,603,200
Req / Sec
0.3
Max Daily Req
19,008
Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.
Die drei Wege, ein LLM zu hosten
Selbst-Hosting ist nicht dasselbe: Sie können GPUs stundenweise mieten, Managed Inference pro Token zahlen oder Hardware kaufen. Jedes Kostenmodell gewinnt in einem anderen Szenario.
Die Wahl hängt vor allem von der Konstanz Ihrer Last ab: Eine gemietete GPU kostet gleich viel, ob genutzt oder nicht.
- GPU-Miete: fester Stundensatz, Sie verwalten den Stack.
- Managed Inference: Zahlung pro Token, keine Leerlaufkosten.
- On-Prem-Hardware: Anfangsinvestition, langfristig niedrigere Stundensätze.
VRAM und Quantisierung
Prüfen Sie vor dem Preisvergleich, ob das Modell auf die betrachtete GPU passt. Quantisierung ist der direkteste Hebel, um den VRAM-Bedarf zu senken.
- FP16/BF16: 2 Byte pro Parameter.
- INT8: halber VRAM-Bedarf, minimaler Qualitätsverlust.
- INT4: ein Viertel VRAM, je nach Benchmark 1-5 % weniger Qualität.
Auslastung und Kosten pro Anfrage
Der Stundensatz ist nur die halbe Wahrheit. Die reale Auslastung bestimmt, wie viel davon in nutzbare Arbeit fließt.
- Schätzen Sie Ihre täglichen Tokens und Anfragen pro Minute zur Spitzenzeit.
- Berechnen Sie die erwartete Auslastung aus Ihrem Traffic-Muster.
- Teilen Sie die Stundenskosten durch die tatsächlich bedienten Anfragen.
- Vergleichen Sie diese Kosten pro Anfrage mit einer Managed API.
Häufig gestellte Fragen
Er schätzt die Infrastrukturkosten, wenn Sie ein großes Sprachmodell selbst betreiben – auf gemieteten Cloud-GPUs, Managed-Serverless-Inference-APIs oder On-Prem-Hardware. Er hilft Entwicklern und Teams, Deployment-Optionen zu vergleichen, Kosten pro Anfrage und Monat zu berechnen, VRAM-Anforderungen zu prüfen und zu entscheiden, ob Selbst-Hosting wirtschaftlicher ist als Managed APIs. Der Rechner läuft 100 % im Browser, ohne Registrierung.
Der Break-even hängt von Anfragevolumen und Modellwahl ab. Bei geringem Volumen (unter 500.000 Tokens/Tag) sind Managed APIs meist günstiger, da keine Leerlauf-GPU-Kosten anfallen. Bei hohem Volumen (über 5 Mio. Tokens/Tag) kosten dedizierte GPU-Miete oder On-Prem-Hardware typischerweise 60-90 % weniger pro Token als Managed APIs für vergleichbare Open-Weight-Modelle.
Llama 3.1 70B benötigt ca. 140 GB VRAM in FP16/BF16 (2× A100 80GB), ~72 GB in INT8 (1× H100 80GB) und ~40 GB in INT4 (1× A100 80GB). Unser Rechner zeigt den VRAM-Bedarf automatisch an, wenn Sie Modell und Quantisierungsstufe wählen, und markiert kompatible Deployment-Optionen.
Sie ist der Anteil der aktiven Zeit, in der die GPU tatsächlich Inferenzanfragen verarbeitet. Niedrige Auslastung (20-30 %) bedeutet, dass Sie für Leerlauf-Compute zahlen, was die effektiven Kosten pro Anfrage erhöht. Hohe Auslastung (70-90 %) amortisiert den Stundensatz besser über mehr Anfragen. Produktions-Inferenzserver mit Continuous Batching (vLLM, TGI) erreichen unter konstanter Last meist 50-80 %.
Cloud-GPU-Miete (RunPod, Vast.ai, Lambda Labs, AWS) gibt Ihnen eine dedizierte GPU zu festem Stundensatz – Sie installieren und verwalten Ihren eigenen Serving-Stack. Managed Inference (Together AI, Groq, Fireworks AI) übernimmt die gesamte Infrastruktur und rechnet pro verbrauchtem Token ab, ohne Leerlaufkosten. GPU-Miete eignet sich für konstante Hochlast, Managed Inference für unvorhersehbare oder geringe Nutzung.
Quantisierung reduziert die Gewichtspräzision von FP16 (2 Byte/Parameter) auf INT8 (1 Byte) oder INT4 (0,5 Byte) und senkt den VRAM-Bedarf um 50-75 %. So läuft ein 70B-Modell auf günstigerer Hardware oder ein größeres Modell auf derselben GPU. INT4-Quantisierung (GGUF Q4, AWQ, GPTQ) kostet 1-5 % Qualität in den meisten Benchmarks – für viele Produktionsfälle akzeptabel.
Sie basieren auf veröffentlichten Benchmark-Werten pro Modell auf H100-SXM-Hardware, skaliert nach GPU-Anzahl und Auslastung. Der tatsächliche Durchsatz hängt von Ihrem Serving-Framework (vLLM, TGI, Ollama), der Batch-Größe, Kontextlänge und Hardwarekonfiguration ab. Betrachten Sie sie als Größenordnungen für die Kapazitätsplanung.
Ja. Der Rechner läuft vollständig im Browser mit clientseitigem JavaScript. Modellauswahl, Nutzungsvolumen, Infrastrukturkosten und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server übertragen. Kein Konto nötig, keine Daten werden gespeichert. Ihre Infrastrukturplanung bleibt völlig privat und sicher.