KI-Infrastruktur-Kostenrechner
Schätzen Sie kostenlos online die gesamten Infrastrukturkosten von KI-Anwendungen. Modellieren Sie Kosten für LLM-API-Tokens, GPU-Compute, Vektordatenbanken, Speicher, Netzwerk-Egress, App-Server, Observability und mehr – mit Monats- und Jahresansicht, geordneter Kostenaufstellung und anpassbarem Sicherheitspuffer.
Estimate total monthly and annual infrastructure expenses for your AI application - covering LLM APIs, GPU compute, storage, networking, orchestration, and observability.
LLM API Usage
Embedding API
GPU / Self-Hosted Compute
Total AI Infrastructure Cost (Monthly)
Compute
$412.16
42.1%
Storage
$18.80
1.9%
Networking
$9.10
0.9%
Ops + Overhead
$539.01
55.1%
All Cost Components - Ranked by Spend
Compute (LLM + GPU)
$412.16/mo
Storage
$18.80/mo
Networking
$9.10/mo
Ops + Overhead
$539.01/mo
Overhead & Contingency
Added to subtotal to cover unexpected usage spikes, support escalations, and untracked minor services.
Die Kostenebenen einer KI-Anwendung
Die Kosten einer KI-App beschränken sich nicht auf LLM-Tokens. Vektordatenbanken, Compute, Speicher, Netzwerk-Egress und Observability summieren sich schnell und werden in ersten Schätzungen oft vergessen.
Gehen Sie jeden Tab durch und geben Sie Ihre realen Volumen für Tokens, Instanzen, Gigabyte und Requests ein, um ein vollständiges Bild der Monats- und Jahreskosten zu erhalten.
- LLM-APIs: Ein- und Ausgabe-Tokens je nach Modell und Request-Volumen.
- GPU-Compute: Instanzstunden und Auslastung für eigene Inferenz oder Training.
- Vektordatenbanken und Speicher: Vektoren, Indizes, Metadaten und Payloads.
- Netzwerk: Daten-Egress, CDN und zonenübergreifender Transfer.
- App-Server, Orchestrierung und Observability: der Rest des Betriebs-Stacks.
So nutzen Sie die Kostenaufstellung
Das Tool sortiert die Kategorien vom höchsten zum niedrigsten Aufwand – beginnen Sie oben, um den größten Optimierungsspielraum zu finden.
- Geben Sie Token-Volumen und Modell ein, um die LLM-API-Kosten zu berechnen.
- Ergänzen Sie Compute, Vektordatenbanken, Speicher, Netzwerk und App-Server.
- Beziehen Sie Observability und einen Sicherheitspuffer von 10–15 % ein.
- Prüfen Sie Aufstellung, Monats- und Jahresansicht, um Ihr Budget festzulegen.
Managed API oder Selbsthosting?
Selbst gehostete Modelle können die Kosten pro Token bei hoher, konstanter Auslastung deutlich senken, sind aber teuer, wenn die GPU oft leer läuft. Vergleichen Sie beide Szenarien mit Ihren eigenen Volumen, bevor Sie entscheiden.
- Unter 60 % GPU-Auslastung sind managed APIs meist günstiger.
- Bei hohem, stabilem Durchsatz kann eine dedizierte GPU die Kosten pro Token stark senken.
- Rechnen Sie Engineering- und Wartungsaufwand für Selbsthosting mit, nicht nur die Instanz.
- Planen Sie einen Sicherheitspuffer für Traffic-Spitzen oder Bots ein.
Häufig gestellte Fragen
Ein KI-Infrastruktur-Kostenrechner schätzt die laufenden Gesamtkosten einer KI-Anwendung über alle Infrastrukturebenen: LLM-APIs, Embedding-APIs, GPU-Compute, Vektordatenbanken, Objektspeicher, relationale Datenbanken, CDN, Netzwerk-Egress, App-Server, Orchestrierung und Observability. Er hilft Entwicklern und Produktteams, realistische Monats- und Jahresbudgets vor dem Produktivgang zu planen. Er läuft vollständig im Browser, ohne Registrierung.
Der Overhead-Prozentsatz addiert einen Sicherheitspuffer auf die modellierten Kosten für unterschätzte kleinere Dienste, unerwartete Nutzungsspitzen (ein viraler Moment oder Bot-Traffic), Preisanpassungen der Anbieter, Support-Eskalationen und schwer prognostizierbare Nebenkosten. Ein Puffer von 10–15 % ist eine gängige Engineering-Best-Practice bei der Cloud-Kostenschätzung.
Nein. Der Rechner läuft zu 100 % clientseitig in Ihrem Browser. Token-Volumen, Instanzanzahl, Speichergrößen und alle Kosteneingaben werden lokal auf Ihrem Gerät verarbeitet und nie an einen Server gesendet. Ihre Infrastrukturdaten sind vollständig privat und sicher.
Selbst gehostete Inferenz wird meist dann wettbewerbsfähig, wenn die GPU-Auslastung dauerhaft über 60–70 % liegt. Bei niedriger Auslastung zahlen Sie für Leerlauf-GPU-Stunden, die managed APIs vermeiden. Bei konstantem Durchsatz kann eine einzelne A100 zu 3 $/Stunde äquivalente Token-Volumen weit günstiger verarbeiten als die Abrechnung pro Token. Nutzen Sie den Compute-Tab, um beide Szenarien mit Ihren Volumen zu vergleichen.
Bei einem RAG-System entstehen Embedding-Kosten aus zwei Quellen: der einmaligen Aufnahme des Korpus (Vektorisierung aller Dokumente) und der laufenden Query-Vektorisierung zur Laufzeit. Für laufende Kosten multiplizieren Sie das tägliche Query-Volumen mit der durchschnittlichen Query-Länge in Tokens und wenden den Preis pro Million Tokens Ihres Anbieters an. text-embedding-3-small von OpenAI kostet 0,02 $/Mio. Tokens – sehr günstig im Vergleich zu LLM-Completion-Kosten.
Egress-Kosten variieren stark je Anbieter. AWS berechnet ~0,09 $/GB ausgehend ins Internet, GCP ~0,08 $/GB und Azure ~0,087 $/GB. Cloudflare Workers und R2 haben keine Egress-Gebühren und eignen sich daher gut als Cache-Schicht. KI-Anwendungen, die lange Antworten streamen oder synthetisiertes Audio oder Bilder liefern, können im großen Maßstab 50–500 GB/Monat Egress erzeugen, was bei traditionellen Cloud-Anbietern schnell ins Gewicht fällt.
Eine grobe Schätzung: Für 1 Million Dokumente mit je 512 Tokens und 1536-dimensionalen float32-Embeddings belegen die Rohvektoren etwa 6 GB vor HNSW-Index-Overhead (der 10–30 % hinzufügt). Mit Metadaten und Payload rechnen Sie mit ~10 GB pro Million Dokumente. Die int8-Quantisierung (von Qdrant unterstützt) reduziert um 4×, binäre Quantisierung um 32×, mit geringen Recall-Einbußen.
Für die meisten KI-Anwendungen sind CDN-Kosten im Vergleich zu LLM-API- und Compute-Kosten minimal. Das CDN ist vor allem für statische Assets (Frontend, Dokumentation) relevant, und große Anbieter verlangen 0,01–1,00 $ pro Million Requests. Wenn Ihre KI-Anwendung jedoch generierte Medien (Bilder, Audio, Video) über CDN ausliefert, können Speicher- und Transferkosten je nach Ausgabevolumen und Dateigröße erheblich werden.