Zum Inhalt springen
Aback Tools Logo

LLM-Hosting-Kostenrechner

Berechnen Sie die Infrastrukturkosten für das Selbst-Hosting eines großen Sprachmodells – kostenlos und 100 % privat im Browser. Vergleichen Sie Cloud-GPU-Mieten (RunPod, Vast.ai, Lambda Labs, AWS), Managed Serverless Inference (Together AI, Groq, Fireworks AI, DeepInfra) und On-Prem-Hardware für gängige Open-Weight-Modelle wie Llama 3.1, Mistral, Qwen, DeepSeek und Gemma. Inklusive VRAM-Kompatibilitätsprüfung, quantisierungsbewusster Dimensionierung, Kosten pro Anfrage und vollständiger Vergleichstabelle.

LLM Hosting Cost Calculator

Calculate the total cost of self-hosting an LLM across cloud GPU rentals, managed serverless inference, and on-premises hardware. Select your model, quantization, and deployment option, then model your usage to get per-request, daily, and monthly cost estimates - fully private, runs 100% in your browser.

Model to Host

Strong open-source frontier model

VRAM Required72 GB
✓ Fits in A100 80GB (80 GB available)

Deployment Option

Cloud GPU (Self-Managed)

Managed Inference (Serverless)

On-Premises Hardware

Usage & Scale

hrs/day
%
reqs/day
tokens
tokens

RunPod - A100 80GB

Monthly Cost

$787.20

Annual Cost

$9,577.60

Cost / Request

$0.0052

Cost / 1K Tokens

$0.0028

Rate: $1.640/hr ·  Daily: $26.24 ·  16h/day active

Monthly Cost Breakdown

GPU Rental$787.20/mo
Networking / egress (est.)$23.62/mo
Total Monthly Estimate$787.20/mo

All Options - Monthly Estimate

Sorted by cost
OptionTypeMonthlyFits Model
Groq - Llama 3.1 70B
Managed$180.15✓ Serverless
DeepInfra - Llama 3.1 70B
Managed$185.25✓ Serverless
Together AI - Llama 3.1 70B
Managed$250.80✓ Serverless
Fireworks AI - Llama 3.1 70B
Managed$256.50✓ Serverless
Vast.ai - A100 80GB
Cloud GPU$672.00✓ 80 GB VRAM
RunPod - A100 80GB Selected
Cloud GPU$787.20✓ 80 GB VRAM
On-Prem - A100 80GB Server
On-Prem$850.00✓ 80 GB VRAM
RunPod - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
Lambda Labs - H100 SXM
Cloud GPU$1,675.20✓ 80 GB VRAM
On-Prem - 8× A100 DGX
On-Prem$5,833.33✓ 5120 GB VRAM
AWS p4d.24xlarge - 8× A100
Cloud GPU$15,732.48✓ 320 GB VRAM
On-Prem - RTX 4090 (×1)
On-Prem-✗ 72GB needed
Vast.ai - RTX 4090
Cloud GPU-✗ 72GB needed
AWS g5.xlarge - A10G
Cloud GPU-✗ 72GB needed

Throughput Estimate

Tokens / Sec

132

Tokens / Day

7,603,200

Req / Sec

0.3

Max Daily Req

19,008

Based on ~220 tok/s reference throughput (H100 SXM), scaled by GPU count and utilization. Actual numbers vary by model framework and serving stack.

Disclaimer: Prices reflect publicly available on-demand rates and are indicative only. Actual costs depend on reserved/spot pricing, network egress, storage, software licensing (e.g. vLLM, TGI), and negotiated enterprise discounts. On-prem costs exclude engineering time, maintenance, and facility overheads. All calculations run locally in your browser - no data is sent to any server.

Die drei Wege, ein LLM zu hosten

Selbst-Hosting ist nicht dasselbe: Sie können GPUs stundenweise mieten, Managed Inference pro Token zahlen oder Hardware kaufen. Jedes Kostenmodell gewinnt in einem anderen Szenario.

Die Wahl hängt vor allem von der Konstanz Ihrer Last ab: Eine gemietete GPU kostet gleich viel, ob genutzt oder nicht.

  • GPU-Miete: fester Stundensatz, Sie verwalten den Stack.
  • Managed Inference: Zahlung pro Token, keine Leerlaufkosten.
  • On-Prem-Hardware: Anfangsinvestition, langfristig niedrigere Stundensätze.

VRAM und Quantisierung

Prüfen Sie vor dem Preisvergleich, ob das Modell auf die betrachtete GPU passt. Quantisierung ist der direkteste Hebel, um den VRAM-Bedarf zu senken.

  • FP16/BF16: 2 Byte pro Parameter.
  • INT8: halber VRAM-Bedarf, minimaler Qualitätsverlust.
  • INT4: ein Viertel VRAM, je nach Benchmark 1-5 % weniger Qualität.

Auslastung und Kosten pro Anfrage

Der Stundensatz ist nur die halbe Wahrheit. Die reale Auslastung bestimmt, wie viel davon in nutzbare Arbeit fließt.

  1. Schätzen Sie Ihre täglichen Tokens und Anfragen pro Minute zur Spitzenzeit.
  2. Berechnen Sie die erwartete Auslastung aus Ihrem Traffic-Muster.
  3. Teilen Sie die Stundenskosten durch die tatsächlich bedienten Anfragen.
  4. Vergleichen Sie diese Kosten pro Anfrage mit einer Managed API.

Häufig gestellte Fragen

Er schätzt die Infrastrukturkosten, wenn Sie ein großes Sprachmodell selbst betreiben – auf gemieteten Cloud-GPUs, Managed-Serverless-Inference-APIs oder On-Prem-Hardware. Er hilft Entwicklern und Teams, Deployment-Optionen zu vergleichen, Kosten pro Anfrage und Monat zu berechnen, VRAM-Anforderungen zu prüfen und zu entscheiden, ob Selbst-Hosting wirtschaftlicher ist als Managed APIs. Der Rechner läuft 100 % im Browser, ohne Registrierung.

Der Break-even hängt von Anfragevolumen und Modellwahl ab. Bei geringem Volumen (unter 500.000 Tokens/Tag) sind Managed APIs meist günstiger, da keine Leerlauf-GPU-Kosten anfallen. Bei hohem Volumen (über 5 Mio. Tokens/Tag) kosten dedizierte GPU-Miete oder On-Prem-Hardware typischerweise 60-90 % weniger pro Token als Managed APIs für vergleichbare Open-Weight-Modelle.

Llama 3.1 70B benötigt ca. 140 GB VRAM in FP16/BF16 (2× A100 80GB), ~72 GB in INT8 (1× H100 80GB) und ~40 GB in INT4 (1× A100 80GB). Unser Rechner zeigt den VRAM-Bedarf automatisch an, wenn Sie Modell und Quantisierungsstufe wählen, und markiert kompatible Deployment-Optionen.

Sie ist der Anteil der aktiven Zeit, in der die GPU tatsächlich Inferenzanfragen verarbeitet. Niedrige Auslastung (20-30 %) bedeutet, dass Sie für Leerlauf-Compute zahlen, was die effektiven Kosten pro Anfrage erhöht. Hohe Auslastung (70-90 %) amortisiert den Stundensatz besser über mehr Anfragen. Produktions-Inferenzserver mit Continuous Batching (vLLM, TGI) erreichen unter konstanter Last meist 50-80 %.

Cloud-GPU-Miete (RunPod, Vast.ai, Lambda Labs, AWS) gibt Ihnen eine dedizierte GPU zu festem Stundensatz – Sie installieren und verwalten Ihren eigenen Serving-Stack. Managed Inference (Together AI, Groq, Fireworks AI) übernimmt die gesamte Infrastruktur und rechnet pro verbrauchtem Token ab, ohne Leerlaufkosten. GPU-Miete eignet sich für konstante Hochlast, Managed Inference für unvorhersehbare oder geringe Nutzung.

Quantisierung reduziert die Gewichtspräzision von FP16 (2 Byte/Parameter) auf INT8 (1 Byte) oder INT4 (0,5 Byte) und senkt den VRAM-Bedarf um 50-75 %. So läuft ein 70B-Modell auf günstigerer Hardware oder ein größeres Modell auf derselben GPU. INT4-Quantisierung (GGUF Q4, AWQ, GPTQ) kostet 1-5 % Qualität in den meisten Benchmarks – für viele Produktionsfälle akzeptabel.

Sie basieren auf veröffentlichten Benchmark-Werten pro Modell auf H100-SXM-Hardware, skaliert nach GPU-Anzahl und Auslastung. Der tatsächliche Durchsatz hängt von Ihrem Serving-Framework (vLLM, TGI, Ollama), der Batch-Größe, Kontextlänge und Hardwarekonfiguration ab. Betrachten Sie sie als Größenordnungen für die Kapazitätsplanung.

Ja. Der Rechner läuft vollständig im Browser mit clientseitigem JavaScript. Modellauswahl, Nutzungsvolumen, Infrastrukturkosten und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server übertragen. Kein Konto nötig, keine Daten werden gespeichert. Ihre Infrastrukturplanung bleibt völlig privat und sicher.