GPU-Kostenrechner
Schätzen Sie GPU-Infrastrukturkosten bei Cloud-Anbietern und eigener Hardware. Vergleichen Sie Instanzpreise für H100, A100, L4, RTX 4090 und MI300X von AWS, GCP, Azure, Lambda Labs, RunPod und Vast.ai – mit Spot-Rabattmodellierung, GPU-Auslastungsanalyse und On-Prem-Break-even-Vergleich. Läuft 100 % im Browser.
Estimate GPU infrastructure costs across cloud providers and on-prem hardware. Compare hourly rates, spot discounts, and monthly totals for any GPU workload - runs privately in your browser.
Cloud Instance / GPU
GPU Specs: NVIDIA A10G
Workload Profile
Estimated Monthly GPU Cost
Annual Cost
$8,691.84
Per GPU-Hour
$1.006
Active Hours/Mo
720
Cost/Compute Hr
$1.44
Instance Cost Comparison
Same workload · sorted by monthly cost| Instance | $/hr | Monthly | Annual |
|---|---|---|---|
Vast.ai1× RTX 4090 24GB VRAM · 1 GPU | $0.350 | $252.00 | $3,024.00 |
GCPg2-standard-4 24GB VRAM · 1 GPU | $0.700 | $504.00 | $6,048.00 |
AWSg5.xlarge Selected 24GB VRAM · 1 GPU | $1.006 | $724.32 | $8,691.84 |
Lambda Labs1× A100 40GB 40GB VRAM · 1 GPU | $1.290 | $928.80 | $11,145.60 |
Vast.ai1× A100 80GB 80GB VRAM · 1 GPU | $1.400 | $1,008.00 | $12,096.00 |
RunPod1× A100 80GB 80GB VRAM · 1 GPU | $1.640 | $1,180.80 | $14,169.60 |
RunPod1× H100 SXM 80GB VRAM · 1 GPU | $3.490 | $2,512.80 | $30,153.60 |
AzureNC A100 v4 80GB VRAM · 1 GPU | $3.670 | $2,642.40 | $31,708.80 |
Lambda Labs8× H100 SXM5 80GB 80GB VRAM · 8 GPUs | $26.800 | $19,296.00 | $231,552.00 |
AWSp4d.24xlarge 40GB VRAM · 8 GPUs | $32.770 | $23,594.40 | $283,132.80 |
GCPa2-highgpu-8g 40GB VRAM · 8 GPUs | $32.770 | $23,594.40 | $283,132.80 |
AWSp4de.24xlarge 80GB VRAM · 8 GPUs | $40.970 | $29,498.40 | $353,980.80 |
Was die GPU-Rechnung bestimmt
Die Rechnung hängt nicht nur vom GPU-Typ ab: tägliche Nutzungsstunden, Anzahl der Karten und der anwendbare Rabatt wirken ebenso stark wie der Stundenpreis.
Wählen Sie Instanz, Stunden pro Tag, GPU-Anzahl und Spot-Rabatt, um Monats- und Jahreskosten sowie die Variante in effektiven Rechenstunden zu erhalten.
- Abgerechnete Stunden = laufende Instanz, auch wenn die GPU unbeschäftigt ist.
- Spot und Preemptible senken den Preis um 50-70 %, auf Kosten möglicher Unterbrechungen.
- Die echte Auslastung wandelt abgerechnete Stunden in nutzbare Rechenstunden um.
Die GPU nach Arbeitslast wählen
Die stärkste GPU ist nicht immer die wirtschaftlichste. Entscheidend ist, ob Ihre Last durchsatz-, speicher- oder latenzgebunden ist.
- Durchsatzgebundene Lasten (große Trainings-Batches): H100 lohnt sich meist.
- Speichergebundene Lasten (kleine Inferenz-Batches): A100 oder L40S können günstiger sein.
- Benötigter VRAM in FP16: Modellgewichte plus 20-30 % Reserve für den Kontext.
Cloud und On-Prem vergleichen
Der Kauf lohnt sich nur bei hoher, dauerhafter Auslastung. Bei sporadischer Nutzung zahlen Sie die Fixkosten ohne Gegenwert.
- Schätzen Sie Ihre monatlichen GPU-Stunden und die durchschnittliche Auslastung.
- Berechnen Sie die äquivalenten Cloud-Kosten mit und ohne Spot-Rabatt.
- Vergleichen Sie mit Abschreibung plus Strom für On-Prem über 18-36 Monate.
- Entscheiden Sie nach Break-even und Ihrer Toleranz gegenüber Unterbrechungsrisiken.
Häufig gestellte Fragen
Er schätzt die finanziellen Kosten GPU-beschleunigter Workloads in Cloud-Infrastruktur oder On-Prem-Hardware. Er berechnet stündliche, monatliche und jährliche Ausgaben anhand von Instanztyp, Nutzungsstunden pro Tag, GPU-Anzahl und optionalen Spot-Rabatten – für ein vollständiges Infrastrukturbudget vor der Ressourcenbindung.
Spot-Instanzen (AWS) und Preemptible VMs (GCP) nutzen überschüssige Cloud-Kapazität mit hohen Rabatten – meist 50-70 % unter On-Demand. Der Nachteil: Die Instanz kann mit 2 Minuten Vorlauf unterbrochen werden. Ideal für Trainingsläufe mit Checkpointing, Batch-Inferenz und Lasten, die Neustarts tolerieren.
Grobe Richtwerte für FP16-Gewichte: 7B Parameter ≈ 14 GB VRAM, 13B ≈ 26 GB, 34B ≈ 68 GB, 70B ≈ 140 GB. INT8-Quantisierung halbiert den Bedarf, INT4/GPTQ viertelt ihn. Planen Sie immer 20-30 % Reserve für KV-Cache und Aktivierungen in der Inferenz. Beim Training brauchen Sie meist 3-4× so viel VRAM wie bei der Inferenz.
Die H100 SXM bietet etwa 3× den FP16-Durchsatz und ~1,7× die Speicherbandbreite der A100 80GB. Sie kostet aber auch 3-4× mehr pro Stunde. Bei durchsatzgebundenen Lasten (große Batch-Trainings) ist die H100 oft kosteneffizienter. Bei speichergebundenen Lasten (kleine Batch-Inferenz) rechtfertigt der Aufpreis den Nutzen möglicherweise nicht – eine A100 oder L40S kann wirtschaftlicher sein.
On-Prem gewinnt bei dauerhaft hoher GPU-Auslastung (60 %+) über einen langen Zeitraum (18+ Monate). Bei hoher Auslastung fallen die Stundenskosten eigener Hardware (Abschreibung + Strom) für H100-Klasse-GPUs meist nach 12-18 Monaten unter die Cloud-On-Demand-Preise. Die Cloud gewinnt bei variablen Lasten, kurzen Projekten oder wenn Skalierung ohne Vorabinvestition nötig ist.
GPU-Stunden (oder Wanduhrstunden) sind das, was der Anbieter abrechnet: die Laufzeit der Instanz, unabhängig von der tatsächlichen Auslastung. Compute-Stunden (effektive Rechenstunden) berücksichtigen die reale GPU-Auslastung. Eine GPU mit 50 % Auslastung über 10 Stunden liefert 5 effektive Rechenstunden, wird aber mit 10 GPU-Stunden abgerechnet.
Die Preise spiegeln indikative On-Demand-Tarife großer Cloud-Anbieter und spezialisierter GPU-Clouds mit Stand Mitte 2025. Reale Preise variieren nach Region, Commitments und Spot-Verfügbarkeit. Prüfen Sie aktuelle Preise stets auf der Seite Ihres Anbieters, bevor Sie ein Budget festlegen. Der Rechner dient Planung und Vergleich, nicht als Abrechnungsgarantie.
Vollständig. Der Rechner läuft zu 100 % im Browser. Alle Eingaben – Instanzauswahl, Nutzungsstunden, eigene Preise und On-Prem-Kosten – werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet. Keine Registrierung nötig.