Multi-Agent-Kostenrechner
Berechnen Sie die Kosten von Systemen mit mehreren zusammenarbeitenden KI-Agenten. Fügen Sie jeden Agenten Ihrer Pipeline hinzu, weisen Sie ein Modell zu, konfigurieren Sie Token-Größen und Aufrufhäufigkeit und erhalten Sie präzise Gesamtkosten pro Aufgabe – mit Tages-, Monats- und Jahresprojektionen.
Add each agent in your pipeline, configure its model, token sizes, and call frequency per task. The calculator totals all agent costs and projects spending for any time period.
Agent Pipeline (3 agents)
Add Agent
Workload Volume
Total Monthly System Cost
Cost per Task (All Agents)
$0.1875
Active Agents
3
Agent Cost Breakdown
Per task, descending| Agent | Model | Calls | Cost/Task | Monthly Cost |
|---|---|---|---|---|
Researcher 12,000 in · 1,500 out | GPT-4o OpenAI | 3× | $0.1350 72% | $2,025.00 |
Orchestrator 8,000 in · 2,000 out | GPT-5.4 OpenAI | 1× | $0.0500 27% | $750.00 |
Executor / Worker 5,000 in · 800 out | GPT-4o Mini OpenAI | 2× | $0.00246 1% | $36.90 |
| Total | $0.1875 | $2,811.90 |
Cost Distribution
Warum Multi-Agent-Systeme mehr kosten als erwartet
Jeder Agent ist ein eigener API-Aufruf. Eine mehrstufige Pipeline vervielfacht die Aufrufzahl viel schneller als erwartet.
Diesen Multiplikator sichtbar zu machen, ermöglicht Optimierung vor dem Skalieren.
- Gesamtaufrufe = Aufgaben pro Zeitraum × Aufrufe pro Aufgabe × Anzahl der Agenten.
- Hochfrequente Agenten belasten die Rechnung am stärksten.
- Recherche- und Kritikschleifen fügen wiederholte Aufrufe hinzu.
Gestufte Modellzuweisung
Nicht jeder Agent braucht ein Spitzenmodell. Reservieren Sie Leistung dort, wo sie Wert bringt, und nutzen Sie günstige Modelle für repetitive Arbeit.
- Orchestrator und Planer: Frontier-Modell.
- Arbeitsagenten für Extraktion, Klassifikation und Formatierung: schnelles, günstiges Modell.
- Prompt-Caching für große, stabile Systemkontexte.
Die Berechnung einrichten
Tragen Sie jeden Agenten mit Modell, Ein- und Ausgabe-Tokens und Aufrufhäufigkeit ein, um verlässliche Kosten pro Aufgabe zu erhalten.
Projizieren Sie das Ergebnis anschließend auf Tag, Monat und Jahr, um die Budgetwirkung zu sehen.
- Fügen Sie eine Zeile pro Agenten der Pipeline hinzu.
- Weisen Sie Modell und typische Prompt- und Antwortgrößen zu.
- Legen Sie Aufrufe pro Aufgabe gemäß der realen Schleife je Agent fest.
- Aktivieren Sie Caching bei Agenten mit geteiltem Kontext und prüfen Sie die Summe.
Häufig gestellte Fragen
Er schätzt die gesamten LLM-API-Kosten von Systemen, in denen mehrere KI-Agenten zusammenarbeiten. Statt die Kosten eines Modells isoliert zu berechnen, summiert er die Token-Kosten jedes Agenten in der Pipeline – jeweils mit eigenem Modell, Prompt-Größe und Aufrufhäufigkeit – und liefert so präzise Gesamtkosten pro Aufgabe und Zeitraum.
Die Einstellung „Aufrufe pro Aufgabe“ gibt an, wie oft ein Agent bei einem vollständigen Pipeline-Durchlauf aufgerufen wird. Ein Orchestrator, der einmal pro Aufgabe routet, sollte 1 haben. Ein Rechercheagent, der Tools in einer Schleife mehrfach abfragt, 3-5. Ein Kritiker, der jede Teilaufgabe prüft, so viele Aufrufe wie es Teilaufgaben gibt.
Reservieren Sie Frontier-Modelle für komplexe Orchestrierung, Planung oder Reasoning. Weisen Sie schnelle, günstige Modelle (GPT-4o Mini, Claude 3.5 Haiku, Gemini 2.5 Flash, DeepSeek-V4-Flash) den häufig aufgerufenen Arbeitsagenten zu, die Extraktion, Klassifikation, Formatierung oder Tool-Parsing erledigen. Dieser gestufte Ansatz senkt die Kosten meist um 70-90 %.
Agenten, die einen großen gemeinsamen System-Prompt teilen (z. B. eine Wissensbasis oder ein Tool-Schema), profitieren stark vom Prompt-Caching. Aktivieren Sie „Prompt-Caching“ bei jedem Agenten mit stabilem, großem Systemkontext. Geben Sie die Anzahl der gecachten Tokens ein, um die Einsparung in den Kosten pro Aufgabe zu sehen.
Jede Agenten-Invokation ist ein eigenständiger API-Aufruf mit eigener Abrechnung von Eingabe- und Ausgabe-Tokens. Eine Pipeline mit 5 Agenten, die je 2-3 Mal pro Aufgabe aufgerufen werden, erzeugt 10-15 API-Aufrufe pro Durchlauf. Der Rechner macht diesen Overhead sichtbar, damit Sie Aufrufzahlen, Kontextgrößen und Modellwahl vor dem Skalieren optimieren können.
„Aufgaben pro Zeitraum“ ist die Anzahl vollständiger Pipeline-Durchläufe im gewählten Zeitfenster. „Aufrufe pro Aufgabe“ ist die Anzahl der Invokationen eines bestimmten Agenten pro Durchlauf. Gesamt-API-Aufrufe dieses Agenten = Aufgaben pro Zeitraum × Aufrufe pro Aufgabe.
Nein. Der Rechner läuft vollständig im Browser mit clientseitigem JavaScript. Agentenkonfigurationen, Modellauswahlen, Token-Größen und Kostenprojektionen werden nie an einen Server gesendet, protokolliert oder geteilt. Ihr Multi-Agent-Design bleibt vollständig privat.
Ja. Der Rechner ist framework-unabhängig. Ob LangGraph, AutoGen, CrewAI oder eine eigene Pipeline: Die Kosten hängen nur von den verwendeten Modellen und den Token-Volumina pro Invokation ab. Ordnen Sie jedem Knoten bzw. Agenten eine Zeile im Rechner zu, um genaue Projektionen zu erhalten.