Calculadora de custos de agente de pesquisa com IA
Estime grátis e online o custo operacional do seu agente de pesquisa com IA. Modele o volume de consultas de busca, os custos de scraping web, as iterações de raciocínio do LLM e a geração do relatório, e compare entre 11 LLMs com projeções de gasto diário, mensal e anual.
Estimate the operating cost of an AI research agent. Model search query volume, web scraping, multi-step LLM reasoning loops, final report generation, and optional embedding deduplication - then forecast daily, monthly, and yearly spend.
Multi-angle topic investigation with synthesis
Search & Web Scraping (per task)
Full results API - $5/1K queries
LLM Reasoning Loop (per task)
Final Report / Summary
Model & Overhead
Monthly Research Agent Cost - GPT-4o mini
Cost / Task
$0.1329
LLM Cost
$0.0108
Search Cost
$0.0500
Scrape Cost
$0.0600
Cost Breakdown per Research Task
Forecast Summary
Daily
$3.99
30 tasks
Monthly
$119.59
900 tasks
Yearly
$1,455.04
10,950 tasks
LLM Model Comparison
Sorted by lowest cost| Model | Cost/Task | Monthly Total |
|---|---|---|
GPT-4o miniOpenAIBudget Selected $0.15/M in · $0.60/M out | $0.1329 | $119.59 |
DeepSeek-V3DeepSeekBudget $0.27/M in · $1.10/M out | $0.1426 | $128.32 |
Gemini 2.5 FlashGoogleBudget $0.30/M in · $2.50/M out | $0.1576 | $141.87 |
Claude 3.5 HaikuAnthropicBudget $0.80/M in · $4.00/M out | $0.1923 | $173.05 |
o4-miniOpenAIBudget $1.10/M in · $4.40/M out | $0.2081 | $187.31 |
Mistral LargeMistral $2.00/M in · $6.00/M out | $0.2596 | $233.64 |
Gemini 2.5 ProGoogleCapable $1.25/M in · $10.00/M out | $0.2695 | $242.55 |
o3OpenAICapable $2.00/M in · $8.00/M out | $0.2794 | $251.46 |
GPT-4oOpenAICapable $2.50/M in · $10.00/M out | $0.3190 | $287.10 |
Claude 3.7 SonnetAnthropicCapable $3.00/M in · $15.00/M out | $0.3883 | $349.47 |
Grok 3xAI $3.00/M in · $15.00/M out | $0.3883 | $349.47 |
* Search, scraping, and embedding costs are identical across all models. Only LLM costs vary.
As quatro camadas de custo de um agente de pesquisa
O custo de um agente de pesquisa é a soma de buscas, download de páginas, iterações de raciocínio e relatório final. Mudar qualquer um desses fatores pode multiplicar o gasto por tarefa, então vale modelá-los separadamente.
Informe o número de consultas por tarefa, páginas por consulta, iterações do LLM, tokens por iteração e tamanho do relatório para ver o custo por tarefa e a projeção do período.
- API de busca: custo por consulta conforme o provedor escolhido.
- Scraping: custo por página baixada e volume por consulta.
- Loop de raciocínio: tokens de entrada e saída em cada iteração do LLM.
- Relatório final: contexto grande com saída longa na tarifa de saída.
- Deduplicação com embeddings para ignorar páginas quase idênticas.
Como reduzir o custo por tarefa
As maiores alavancas costumam ser o número de iterações e o modelo escolhido, não o provedor de busca. Aprofundar uma iteração custa mais que dezenas de consultas extras de busca.
- Limite as iterações de raciocínio ao mínimo necessário para a qualidade exigida.
- Use modelos pequenos e baratos para classificar e extrair, e um melhor apenas no relatório.
- Reduza o contexto por iteração resumindo o conteúdo coletado em vez de carregá-lo inteiro.
- Ative a deduplicação por embeddings se baixar muitas páginas por consulta.
Montar o orçamento do agente
Separe o custo variável por tarefa do custo fixo de plataforma e multiplique pelo volume esperado. Assim você vê se o gargalo do orçamento está no modelo ou no volume.
- Calcule o custo por tarefa e multiplique pelas tarefas diárias previstas.
- Reserve margem para novas tentativas, páginas com falha e variações de tamanho.
- Compare vários LLMs no mesmo fluxo antes de definir o modelo padrão.
- Revise os preços dos provedores a cada trimestre: mudam com frequência.
Perguntas frequentes
É uma ferramenta que estima o gasto operacional total de um agente autônomo que pesquisa na web, lê páginas e sintetiza informações com um LLM. Ela considera custos de consultas de busca, scraping web, loops de raciocínio do LLM em várias etapas e a geração do relatório final, entregando uma projeção realista por tarefa e por mês antes de construir ou escalar.
O custo total tem quatro componentes principais: (1) custo de API de busca por consulta, (2) custo de scraping por página baixada, (3) custo de tokens do LLM em cada iteração de raciocínio, incluindo contexto de entrada e tokens de saída, e (4) tokens de geração do relatório final. Um quinto componente opcional é a deduplicação por embeddings, que adiciona um pequeno custo de API de embeddings mas pode poupar tokens ao ignorar páginas quase duplicadas.
A calculadora inclui custos predefinidos para a API do Brave Search (US$ 5/1.000), Bing Search v7 (US$ 7/1.000), Serper.dev (US$ 1/1.000), SerpAPI (US$ 5/1.000), a busca neural do Exa.ai (US$ 10/1.000) e a Tavily Research API (US$ 4/1.000). Você também pode informar um custo personalizado por consulta se usar outro provedor ou tiver preço negociado.
Durante o loop de raciocínio, o agente envia contextos de entrada grandes (conteúdo coletado + rascunho) e gera saídas intermediárias mais curtas: notas de análise, ranking de fontes e extrações estruturadas. A etapa do relatório final usa contexto de entrada parecido, mas gera uma saída muito mais longa (o relatório completo), cobrada na tarifa de tokens de saída, geralmente maior. A calculadora separa esses dois blocos de custo do LLM para estimativas precisas.
Os custos variam bastante conforme a configuração. Uma checagem rápida com 3 consultas, 2 páginas cada e 2 iterações do LLM no GPT-4o mini costuma ficar em US$ 0,01-0,05 por tarefa. Uma pesquisa profunda com 10 consultas, 3 páginas cada e 5 iterações no GPT-4o costuma custar US$ 0,20-1,00 por tarefa. O valor exato depende muito do número de páginas, da profundidade das iterações, do tamanho do relatório e do modelo escolhido.
A deduplicação por embeddings faz sentido financeiro quando sua proporção de páginas por consulta é alta (3+) e há bastante sobreposição temática entre as páginas coletadas. Se o agente baixa muitas páginas repetindo o mesmo conteúdo, ignorá-las por similaridade de embeddings reduz os tokens de entrada do LLM, que costumam custar bem mais que o embedding em si. Com pouco volume de páginas ou conteúdo muito original, a deduplicação adiciona custo sem economia relevante.
Sim. A calculadora funciona inteiramente no lado do cliente, no seu navegador. Nenhum parâmetro de uso, valor de custo ou detalhe de configuração é enviado a servidor algum. Tudo é calculado localmente no seu dispositivo e não é preciso conta ou cadastro. Suas estimativas permanecem 100 % privadas.
As estimativas usam as tarifas públicas padrão das APIs no momento da publicação. Os custos reais podem variar por atualizações de preço dos provedores, descontos por volume, cobrança regional ou planos empresariais personalizados. A calculadora serve para planejar e orçar: confira sempre a página de preços atual do seu provedor antes de fechar um orçamento.