Calculadora de costes multiagente
Calcula los gastos de sistemas que usan varios agentes de IA colaborando. Añade cada agente de tu pipeline, asígnale un modelo, configura el tamaño de tokens y la frecuencia de llamadas, y obtén el coste total preciso del sistema por tarea, con proyecciones diarias, mensuales y anuales.
Add each agent in your pipeline, configure its model, token sizes, and call frequency per task. The calculator totals all agent costs and projects spending for any time period.
Agent Pipeline (3 agents)
Add Agent
Workload Volume
Total Monthly System Cost
Cost per Task (All Agents)
$0.1875
Active Agents
3
Agent Cost Breakdown
Per task, descending| Agent | Model | Calls | Cost/Task | Monthly Cost |
|---|---|---|---|---|
Researcher 12,000 in · 1,500 out | GPT-4o OpenAI | 3× | $0.1350 72% | $2,025.00 |
Orchestrator 8,000 in · 2,000 out | GPT-5.4 OpenAI | 1× | $0.0500 27% | $750.00 |
Executor / Worker 5,000 in · 800 out | GPT-4o Mini OpenAI | 2× | $0.00246 1% | $36.90 |
| Total | $0.1875 | $2,811.90 |
Cost Distribution
Por qué los sistemas multiagente cuestan más de lo esperado
Cada agente es una llamada de API independiente. Un pipeline de varios pasos multiplica el número de llamadas mucho más rápido de lo que parece.
Hacer visible ese multiplicador es lo que permite optimizar antes de escalar.
- Llamadas totales = tareas por periodo × llamadas por tarea × número de agentes.
- Los agentes de alta frecuencia son los que más pesan en la factura.
- Los bucles de investigación y crítica añaden llamadas repetidas.
Asignación de modelos por niveles
No todos los agentes necesitan un modelo de primera línea. Reserva la potencia donde aporta valor y usa modelos baratos para el trabajo repetitivo.
- Orquestador y planificador: modelo frontera.
- Trabajadores de extracción, clasificación y formateo: modelo rápido y barato.
- Caché de prompts para contextos de sistema grandes y estables.
Configurar el cálculo
Introduce cada agente con su modelo, tokens de entrada y salida, y frecuencia de llamada para obtener un coste por tarea fiable.
Después proyecta el resultado a día, mes y año para ver el impacto real en el presupuesto.
- Añade una fila por cada agente del pipeline.
- Asigna modelo y tamaños de prompt y respuesta típicos.
- Define las llamadas por tarea según el bucle real de cada agente.
- Activa la caché en los agentes con contexto compartido y revisa el total.
Preguntas frecuentes
Es una herramienta que estima los gastos totales de API de LLM en sistemas donde varios agentes de IA colaboran para completar tareas. En lugar de calcular el coste de un solo modelo de forma aislada, suma los costes de tokens de todos los agentes del pipeline (cada uno con su modelo, tamaño de prompt y frecuencia de llamadas) para dar un coste total preciso del sistema por tarea y por periodo.
El ajuste «llamadas por tarea» representa cuántas veces se invoca un agente concreto en una única ejecución del pipeline. Para un orquestador que enruta una vez por tarea, usa 1. Para un agente de investigación que consulta herramientas varias veces en bucle, usa 3-5. Para un crítico que revisa la salida de cada subtarea, usa el número de subtareas de tu flujo.
Reserva los modelos frontera para la orquestación, planificación o razonamiento de alta complejidad. Asigna modelos rápidos y económicos (GPT-4o Mini, Claude 3.5 Haiku, Gemini 2.5 Flash, DeepSeek-V4-Flash) a los agentes trabajadores de alta frecuencia que hacen extracción, clasificación, formateo o análisis de herramientas. Este enfoque por niveles suele reducir el coste del sistema multiagente un 70-90 %.
Los agentes que comparten un prompt de sistema grande y común (como una base de conocimiento o un esquema de herramientas compartido) se benefician mucho de la caché de prompts. Activa el interruptor «Caché de prompts» en cualquier agente con un contexto de sistema estable y grande. Introduce el número de tokens en caché para ver el ahorro reflejado en el coste por tarea.
Cada invocación de agente es una llamada de API independiente con su propia facturación de tokens de entrada y salida. Un pipeline con 5 agentes, cada uno llamado 2-3 veces por tarea, genera 10-15 llamadas por tarea completa. La calculadora hace visible esa sobrecarga para que puedas optimizar el número de llamadas, el tamaño del contexto y la elección de modelos antes de escalar.
«Tareas por periodo» es el número de veces que tu pipeline completo se ejecuta de principio a fin en la ventana de tiempo elegida. «Llamadas por tarea» es cuántas veces se invoca un agente concreto en una sola ejecución. Total de llamadas de API de ese agente = tareas por periodo × llamadas por tarea.
No. La calculadora multiagente funciona íntegramente en tu navegador con JavaScript del lado del cliente. Las configuraciones de agentes, selecciones de modelo, tamaños de tokens y proyecciones de coste nunca se suben a un servidor, ni se registran ni se comparten. El diseño de tu sistema multiagente permanece totalmente privado.
Sí. La calculadora es agnóstica al framework. Uses LangGraph, AutoGen, CrewAI o un pipeline propio, el coste depende solo de los modelos usados y de los volúmenes de tokens por invocación. Mapea cada nodo o agente de tu framework a una fila de la calculadora para obtener proyecciones precisas.