Calculadora de custos multiagente
Calcule os gastos de sistemas que usam vários agentes de IA colaborando. Adicione cada agente do seu pipeline, atribua um modelo, configure tamanhos de tokens e frequência de chamadas, e obtenha o custo total preciso do sistema por tarefa - com projeções diárias, mensais e anuais.
Add each agent in your pipeline, configure its model, token sizes, and call frequency per task. The calculator totals all agent costs and projects spending for any time period.
Agent Pipeline (3 agents)
Add Agent
Workload Volume
Total Monthly System Cost
Cost per Task (All Agents)
$0.1875
Active Agents
3
Agent Cost Breakdown
Per task, descending| Agent | Model | Calls | Cost/Task | Monthly Cost |
|---|---|---|---|---|
Researcher 12,000 in · 1,500 out | GPT-4o OpenAI | 3× | $0.1350 72% | $2,025.00 |
Orchestrator 8,000 in · 2,000 out | GPT-5.4 OpenAI | 1× | $0.0500 27% | $750.00 |
Executor / Worker 5,000 in · 800 out | GPT-4o Mini OpenAI | 2× | $0.00246 1% | $36.90 |
| Total | $0.1875 | $2,811.90 |
Cost Distribution
Por que sistemas multiagente custam mais que o esperado
Cada agente é uma chamada de API separada. Um pipeline com várias etapas multiplica o número de chamadas bem mais rápido do que parece.
Tornar esse multiplicador visível é o que permite otimizar antes de escalar.
- Chamadas totais = tarefas por período × chamadas por tarefa × número de agentes.
- Agentes de alta frequência são os que mais pesam na fatura.
- Loops de pesquisa e crítica adicionam chamadas repetidas.
Atribuição de modelos em camadas
Nem todo agente precisa de um modelo de ponta. Reserve o poder onde ele agrega valor e use modelos baratos para o trabalho repetitivo.
- Orquestrador e planejador: modelo de fronteira.
- Trabalhadores de extração, classificação e formatação: modelo rápido e barato.
- Cache de prompts para contextos de sistema grandes e estáveis.
Configurar o cálculo
Insira cada agente com seu modelo, tokens de entrada e saída e frequência de chamadas para obter um custo por tarefa confiável.
Depois projete o resultado para dia, mês e ano para ver o impacto real no orçamento.
- Adicione uma linha para cada agente do pipeline.
- Atribua modelo e tamanhos típicos de prompt e resposta.
- Defina as chamadas por tarefa conforme o loop real de cada agente.
- Ative o cache nos agentes com contexto compartilhado e revise o total.
Perguntas frequentes
É uma ferramenta que estima os gastos totais de API de LLM em sistemas onde vários agentes de IA colaboram para concluir tarefas. Em vez de calcular o custo de um modelo isoladamente, ela soma os custos de tokens de todos os agentes do pipeline — cada um com seu modelo, tamanho de prompt e frequência de chamadas — para dar um custo total preciso por tarefa e por período.
O ajuste «chamadas por tarefa» representa quantas vezes um agente é invocado em uma única execução do pipeline. Para um orquestrador que roteia uma vez por tarefa, use 1. Para um agente de pesquisa que consulta ferramentas várias vezes em um loop, use 3-5. Para um crítico que revisa a saída de cada subtarefa, use o número de subtarefas do fluxo.
Reserve modelos de fronteira para orquestração, planejamento ou raciocínio de alta complexidade. Atribua modelos rápidos e baratos (GPT-4o Mini, Claude 3.5 Haiku, Gemini 2.5 Flash, DeepSeek-V4-Flash) aos agentes trabalhadores de alta frequência que fazem extração, classificação, formatação ou análise de ferramentas. Essa abordagem em camadas costuma reduzir o custo do sistema multiagente em 70-90 %.
Agentes que compartilham um grande prompt de sistema comum (como uma base de conhecimento ou um esquema de ferramentas compartilhado) se beneficiam muito do cache de prompts. Ative o interruptor «Cache de prompts» em qualquer agente com contexto de sistema estável e grande. Informe o número de tokens em cache para ver a economia refletida no custo por tarefa.
Cada invocação de agente é uma chamada de API independente com sua própria cobrança de tokens de entrada e saída. Um pipeline com 5 agentes, cada um chamado 2-3 vezes por tarefa, gera 10-15 chamadas por tarefa completa. A calculadora torna essa sobrecarga visível para você otimizar número de chamadas, tamanho de contexto e escolha de modelos antes de escalar.
«Tarefas por período» é quantas vezes seu pipeline completo roda de ponta a ponta na janela de tempo escolhida. «Chamadas por tarefa» é quantas vezes um agente específico é invocado em uma única execução. Total de chamadas de API do agente = tarefas por período × chamadas por tarefa.
Não. A calculadora multiagente roda inteiramente no seu navegador com JavaScript do lado do cliente. Configurações de agentes, seleções de modelo, tamanhos de tokens e projeções de custo nunca são enviados a servidor algum, registrados ou compartilhados. O design do seu sistema multiagente permanece totalmente privado.
Sim. A calculadora é agnóstica a framework. Use LangGraph, AutoGen, CrewAI ou um pipeline próprio, o custo depende apenas dos modelos usados e dos volumes de tokens por invocação. Mapeie cada nó ou agente do seu framework para uma linha da calculadora e obtenha projeções precisas.