Zum Inhalt springen
Aback Tools Logo

Self-Hosted-KI-Kostenrechner

Vergleichen Sie die echten Kosten des Selbst-Hostings von Open-Source-LLMs mit Managed-API-Anbietern – kostenlos und 100 % privat im Browser. Konfigurieren Sie Ihre Arbeitslast, wählen Sie eine GPU-Infrastruktur (RunPod, Vast.ai, Lambda, AWS, GCP, On-Prem), ergänzen Sie DevOps-Overhead und erhalten Sie einen direkten Monatsvergleich, Kosten pro Million Tokens, eine Durchsatzkapazitätsprüfung und die On-Prem-Break-even-Periode.

Self-Hosted AI Cost Calculator

Compare the true cost of self-hosting an open-source LLM against managed API providers. Configure your workload, choose an infrastructure option, and see side-by-side monthly costs, cost per token, and break-even analysis - all privately in your browser.

Model & Workload

Min VRAM: 16GBQuantized: ~5GBSpeed: ~120 tok/sGPU: A10G / L4 / RTX 4090
req/d
tok
tok
Monthly tokens: 375.0M ·  Tokens/request: 2,500

Infrastructure Option

GPU: NVIDIA A10G · On-demand: $0.76/hr
hrs/d
%

Operational Overhead

$/mo
$/mo

Managed API to Compare

In/1M: $0.15Out/1M: $0.60Per request: $0.000600
3 months12 months36 months
⚠️ Capacity gap: At 60% utilization, this setup handles ~2,488 req/day but you need 5,000. You may need ~3× this instance to meet demand.

Monthly Cost Comparison

Self-Hosted

$2.2K/mo

$5.99/1M tokens

OpenAI API

$90.00/mo

$0.3750/1M tokens (avg)

📡 Managed API saves $2.2K/mo at this workload - self-hosting becomes cost-effective at higher volumes

Self-Host / Mo

$2.2K

API / Mo

$90.00

12-Mo Self-Host

$27.0K

12-Mo API

$1.1K

Self-Hosting Cost Breakdown

Cloud GPU Rental$547.20/mo (24%)
ML Ops / DevOps Labour$1.5K/mo (67%)
Misc. Infra & Networking$200.00/mo (9%)

Cloud GPU Options Comparison

Sorted by cost
Option$/hrMonthly$/1M tokens
Vast.ai - RTX 4090
RTX 4090
$0.350$2.0K$5.21
RunPod - L4 24GB
NVIDIA L4
$0.440$2.0K$5.38
GCP g2-standard-4 (L4)
NVIDIA L4
$0.700$2.2K$5.88
RunPod - A10G 24GB Selected
NVIDIA A10G
$0.760$2.2K$5.99
AWS g5.xlarge (A10G)
NVIDIA A10G
$1.006$2.4K$6.46
Lambda - A100 40GB
NVIDIA A100
$1.290$2.6K$7.01
Vast.ai - A100 80GB
NVIDIA A100
$1.400$2.7K$7.22
RunPod - A100 80GB
NVIDIA A100
$1.640$2.9K$7.68
RunPod - H100 SXM
NVIDIA H100
$3.490$4.2K$11.23
Azure NC A100 v4
NVIDIA A100
$3.670$4.3K$11.58
OpenAI - GPT-4o Mini
Managed API
pay-per-use$90.00$0.3750
Disclaimer: Cost estimates use current market pricing and typical throughput benchmarks. Actual self-hosting costs depend on your model, serving framework, batching efficiency, GPU availability, and ops overhead. API pricing changes frequently - always verify with official provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Die echten Kosten liegen über dem GPU-Preis

Die Stundenmiete ist nur der sichtbarste Posten. Engineering-Zeit, Netzwerk und Speicher addieren oft 30 bis 60 % auf die Bruttokosten.

Nur den GPU-Tarif mit dem Token-Preis einer API zu vergleichen, führt zu falschen Schlüssen.

  • GPU: Stundensatz × Stunden im Monat.
  • DevOps: Engineering-Stunden × Vollkostensatz.
  • Extras: Netzwerk, Speicher und Framework-Einrichtung.

Auslastung und Quantisierung

Die effektiven Kosten pro Token hängen sowohl von der Auslastung als auch vom Stundensatz ab. Eine halbleere GPU verdoppelt Ihre Stückkosten.

  • Niedrige Auslastung = proportional höhere Kosten pro Token.
  • Batching und vLLM verbessern die Auslastung im Produktivbetrieb.
  • INT4/Q4 senkt VRAM und erlaubt größere Modelle auf günstigeren GPUs.

Wann welche Option gewinnt

Die Cloud gewinnt bei variablen Lasten oder kurzen Projekten. On-Prem-Hardware gewinnt bei hoher, konstanter Nutzung über Jahre.

  1. Schätzen Sie Ihre täglichen Tokens und die nachhaltige Auslastung.
  2. Berechnen Sie die Monatskosten für Selbst-Hosting mit GPU und DevOps.
  3. Vergleichen Sie mit dem Managed-API-Preis für dieselbe Last.
  4. Bei stabilem, hohem Nutzen die On-Prem-Amortisation über 3-4 Jahre rechnen.

Häufig gestellte Fragen

Er schätzt die gesamten Monatskosten für den Betrieb von Open-Source-LLMs auf eigener GPU-Infrastruktur – einschließlich GPU-Miete oder amortisierter Hardwarekosten, DevOps-Arbeitszeit und Betriebs-Overhead – und vergleicht das mit Managed-API-Preisen für dieselbe Arbeitslast.

Der Break-even hängt von Modell, GPU-Effizienz und Ops-Overhead ab. Für kleine Modelle wie Llama 3.1 8B wird Selbst-Hosting ab etwa 500.000 bis 2 Mio. Tokens/Tag wettbewerbsfähig. Für 70B-Modelle liegt der Break-even typisch bei 5-20 Mio. Tokens/Tag.

Der GPU-Stundensatz ist nur ein Teil der echten Kosten. DevOps-Engineering-Zeit (500-3.000 $/Monat), Netzwerk, Speicher und die Einrichtung des Serving-Frameworks addieren 30-60 % auf die reinen GPU-Kosten. Rechnen Sie diese stets mit ein.

Sie ist der Anteil der GPU-Compute-Leistung, der aktiv Anfragen verarbeitet. Bei 30 % Auslastung sind Ihre effektiven Kosten pro Token 3× höher als bei 90 %. Request-Batching und Frameworks wie vLLM sind entscheidend für hohe Auslastung und wirtschaftliche Wettbewerbsfähigkeit.

Quantisierung (INT4/Q4) senkt den VRAM-Bedarf um ca. 70 % und erlaubt größere Modelle auf günstigeren GPUs. Der Nachteil: 10-20 % weniger Durchsatz und leichte Qualitätseinbußen. Für die meisten Produktions-Inferenzlasten ist das ein guter Kompromiss, wenn VRAM der Engpass ist.

Für ein einfaches Single-Model-Cloud-Deployment planen Sie 5-20 Stunden/Monat Engineer-Zeit ein. Bei 80-150 $/h Vollkosten sind das 400-3.000 $/Monat. Starten Sie mit 10-20 Stunden/Monat und erfassen Sie die tatsächliche Zeit im ersten Quartal.

Ja. Der Rechner läuft vollständig im Browser. Workload-Volumen, Infrastrukturwahl und alle Ergebnisse werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet, gespeichert oder geteilt. Kein Login nötig.

Für günstige kleine Modelle: Vast.ai (~0,35 $/h RTX 4090) und RunPod (~0,44 $/h L4). Für Produktions-Inferenz 7-13B: RunPod oder Lambda (A10G/A100 zu 0,76-1,64 $/h). Für 70B+-Modelle: RunPod H100 (3,49 $/h). Für stabile, kosteneffiziente Lasten: On-Prem-Hardware über 3-4 Jahre amortisiert.