Self-Hosted-KI-Kostenrechner
Vergleichen Sie die echten Kosten des Selbst-Hostings von Open-Source-LLMs mit Managed-API-Anbietern – kostenlos und 100 % privat im Browser. Konfigurieren Sie Ihre Arbeitslast, wählen Sie eine GPU-Infrastruktur (RunPod, Vast.ai, Lambda, AWS, GCP, On-Prem), ergänzen Sie DevOps-Overhead und erhalten Sie einen direkten Monatsvergleich, Kosten pro Million Tokens, eine Durchsatzkapazitätsprüfung und die On-Prem-Break-even-Periode.
Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.
Model & Workload
Infrastructure Option
Operational Overhead
Managed API to Compare
Monthly Cost Comparison
$2.2K/mo
$5.99/1M tokens
$90.00/mo
$0.3750/1M tokens (avg)
Self-Host / Mo
$2.2K
API / Mo
$90.00
12-Mo Self-Host
$27.0K
12-Mo API
$1.1K
Self-Hosting Cost Breakdown
Cloud GPU Options Comparison
Sorted by cost| Option | $/hr | Monthly | $/1M tokens |
|---|---|---|---|
Vast.ai - RTX 4090 RTX 4090 | $0.350 | $2.0K | $5.21 |
RunPod - L4 24GB NVIDIA L4 | $0.440 | $2.0K | $5.38 |
GCP g2-standard-4 (L4) NVIDIA L4 | $0.700 | $2.2K | $5.88 |
RunPod - A10G 24GB Selected NVIDIA A10G | $0.760 | $2.2K | $5.99 |
AWS g5.xlarge (A10G) NVIDIA A10G | $1.006 | $2.4K | $6.46 |
Lambda - A100 40GB NVIDIA A100 | $1.290 | $2.6K | $7.01 |
Vast.ai - A100 80GB NVIDIA A100 | $1.400 | $2.7K | $7.22 |
RunPod - A100 80GB NVIDIA A100 | $1.640 | $2.9K | $7.68 |
RunPod - H100 SXM NVIDIA H100 | $3.490 | $4.2K | $11.23 |
Azure NC A100 v4 NVIDIA A100 | $3.670 | $4.3K | $11.58 |
| OpenAI - GPT-4o Mini Managed API | pay-per-use | $90.00 | $0.3750 |
Die echten Kosten liegen über dem GPU-Preis
Die Stundenmiete ist nur der sichtbarste Posten. Engineering-Zeit, Netzwerk und Speicher addieren oft 30 bis 60 % auf die Bruttokosten.
Nur den GPU-Tarif mit dem Token-Preis einer API zu vergleichen, führt zu falschen Schlüssen.
- GPU: Stundensatz × Stunden im Monat.
- DevOps: Engineering-Stunden × Vollkostensatz.
- Extras: Netzwerk, Speicher und Framework-Einrichtung.
Auslastung und Quantisierung
Die effektiven Kosten pro Token hängen sowohl von der Auslastung als auch vom Stundensatz ab. Eine halbleere GPU verdoppelt Ihre Stückkosten.
- Niedrige Auslastung = proportional höhere Kosten pro Token.
- Batching und vLLM verbessern die Auslastung im Produktivbetrieb.
- INT4/Q4 senkt VRAM und erlaubt größere Modelle auf günstigeren GPUs.
Wann welche Option gewinnt
Die Cloud gewinnt bei variablen Lasten oder kurzen Projekten. On-Prem-Hardware gewinnt bei hoher, konstanter Nutzung über Jahre.
- Schätzen Sie Ihre täglichen Tokens und die nachhaltige Auslastung.
- Berechnen Sie die Monatskosten für Selbst-Hosting mit GPU und DevOps.
- Vergleichen Sie mit dem Managed-API-Preis für dieselbe Last.
- Bei stabilem, hohem Nutzen die On-Prem-Amortisation über 3-4 Jahre rechnen.
Häufig gestellte Fragen
Er schätzt die gesamten Monatskosten für den Betrieb von Open-Source-LLMs auf eigener GPU-Infrastruktur – einschließlich GPU-Miete oder amortisierter Hardwarekosten, DevOps-Arbeitszeit und Betriebs-Overhead – und vergleicht das mit Managed-API-Preisen für dieselbe Arbeitslast.
Der Break-even hängt von Modell, GPU-Effizienz und Ops-Overhead ab. Für kleine Modelle wie Llama 3.1 8B wird Selbst-Hosting ab etwa 500.000 bis 2 Mio. Tokens/Tag wettbewerbsfähig. Für 70B-Modelle liegt der Break-even typisch bei 5-20 Mio. Tokens/Tag.
Der GPU-Stundensatz ist nur ein Teil der echten Kosten. DevOps-Engineering-Zeit (500-3.000 $/Monat), Netzwerk, Speicher und die Einrichtung des Serving-Frameworks addieren 30-60 % auf die reinen GPU-Kosten. Rechnen Sie diese stets mit ein.
Sie ist der Anteil der GPU-Compute-Leistung, der aktiv Anfragen verarbeitet. Bei 30 % Auslastung sind Ihre effektiven Kosten pro Token 3× höher als bei 90 %. Request-Batching und Frameworks wie vLLM sind entscheidend für hohe Auslastung und wirtschaftliche Wettbewerbsfähigkeit.
Quantisierung (INT4/Q4) senkt den VRAM-Bedarf um ca. 70 % und erlaubt größere Modelle auf günstigeren GPUs. Der Nachteil: 10-20 % weniger Durchsatz und leichte Qualitätseinbußen. Für die meisten Produktions-Inferenzlasten ist das ein guter Kompromiss, wenn VRAM der Engpass ist.
Für ein einfaches Single-Model-Cloud-Deployment planen Sie 5-20 Stunden/Monat Engineer-Zeit ein. Bei 80-150 $/h Vollkosten sind das 400-3.000 $/Monat. Starten Sie mit 10-20 Stunden/Monat und erfassen Sie die tatsächliche Zeit im ersten Quartal.
Ja. Der Rechner läuft vollständig im Browser. Workload-Volumen, Infrastrukturwahl und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet, gespeichert oder geteilt. Kein Login nötig.
Für günstige kleine Modelle: Vast.ai (~0,35 $/h RTX 4090) und RunPod (~0,44 $/h L4). Für Produktions-Inferenz 7-13B: RunPod oder Lambda (A10G/A100 zu 0,76-1,64 $/h). Für 70B+-Modelle: RunPod H100 (3,49 $/h). Für stabile, kosteneffiziente Lasten: On-Prem-Hardware über 3-4 Jahre amortisiert.