O preço do token caiu, mas o custo total de IA subiu porque agentes fazem muito mais chamadas por tarefa, e o controle vem de roteamento de modelos, orçamento por sessão e atribuição de custo por agente.
Duas coisas verdadeiras ao mesmo tempo: o custo médio de token caiu 67% entre o primeiro trimestre de 2025 e o de 2026, de US$ 18,40 para US$ 6,07 por milhão de tokens, e ainda assim 73% das empresas estouraram o plano de custo de IA, com projetos agênticos passando 2,4 vezes do orçamento. O motivo é volume: agentes fazem de 3 a 10 vezes mais chamadas que um chatbot simples. Quem controla trata custo como requisito de engenharia, com roteamento de modelos, que reduz de 30% a 70%, e cascata bem feita, que chega a 87%.
◆ Pontos-chave
- O custo médio combinado de token caiu 67% entre o 1º trimestre de 2025 e o 1º de 2026, de US$ 18,40 para US$ 6,07 por milhão.
- 73% das empresas excederam o plano original de custo de IA e projetos agênticos estouraram o orçamento por um fator de 2,4.
- Agentes fazem de 3 a 10 vezes mais chamadas de modelo que chatbots simples; uma tarefa complexa sem limite pode custar de US$ 5 a 8 só em API.
- Roteamento sistemático de modelos gera redução de custo relatada entre 30% e 70%.
- Cascata que envia 90% das consultas a modelos mais baratos e reserva o modelo caro para o que é realmente difícil pode chegar a 87% de redução.
Por que a conta de IA sobe se o token está mais barato?#
Porque preço unitário e custo total são coisas diferentes. O custo médio combinado de token caiu 67% entre o primeiro trimestre de 2025 e o primeiro de 2026, de US$ 18,40 para US$ 6,07 por milhão de tokens. Mesmo assim, 73% das empresas excederam o plano original de custo, e projetos agênticos estouraram o orçamento por um fator de 2,4.
A explicação está na mudança de padrão de uso. Um chatbot faz uma chamada por pergunta. Um agente faz muitas: entende o pedido, decide a ação, chama ferramenta, avalia o retorno, decide de novo. Isso resulta em 3 a 10 vezes mais chamadas por interação. Uma tarefa complexa sem restrição pode chegar a US$ 5 a 8 apenas em taxa de API.
Há registro de crescimento de 30 vezes em consultas agênticas em seis meses em operações grandes. Quando o volume multiplica assim, queda de preço unitário não salva ninguém.
Qual a unidade de custo que importa em uma operação comercial?#
Não é custo por token. Ninguém no comercial toma decisão com custo por token. As unidades que sustentam decisão são:
- Custo por conversa: quanto custa um atendimento completo, do primeiro contato à resolução.
- Custo por resultado: quanto custa uma negociação fechada, um lead qualificado, um chamado resolvido.
- Custo por tenant: quanto consome cada cliente, unidade ou parceiro de revenda, se você opera multitenancy.
A boa prática de 2026 é que a atribuição de custo desceu da fatura de nuvem para o token, e do token para a execução individual do agente e a sessão. Sem isso, você descobre o problema no fim do mês.
Para quem revende ou opera white label, custo por tenant não é refinamento: é o que define se o modelo de precificação fecha.
Como reduzir custo sem piorar a qualidade?#
Quatro alavancas, da mais eficaz para a mais sutil:
- Roteamento de modelos. Nem toda pergunta precisa do modelo mais caro. Organizações com roteamento sistemático relatam redução de 30% a 70%. Uma cascata bem feita, que envia 90% das consultas a modelos mais baratos e reserva o modelo caro para o que é genuinamente difícil, chega a 87% de redução.
- Orçamento de tokens por sessão. Definir teto por conversa evita o caso patológico do agente que entra em laço e consome dezenas de chamadas.
- Contexto enxuto. Enviar a política comercial inteira em cada chamada é o desperdício mais comum. Agentes especializados, com escopo estreito, carregam menos contexto por chamada.
- Resolver em menos turnos. Isso reduz token e, a partir de outubro de 2026, reduz também custo de mensagem no WhatsApp. Vale dobrado.
Note que três das quatro alavancas são arquiteturais, não de negociação com fornecedor. É por isso que a camada de orquestração define o custo mais do que o preço de tabela do modelo.
O que colocar no painel semanal de custo?#
Um painel útil de FinOps de IA em operação comercial tem seis linhas, não sessenta:
- Custo total do período e variação contra o período anterior.
- Custo por conversa, com mediana e cauda (as conversas mais caras revelam laços e falhas).
- Custo por resultado de negócio, por operação.
- Distribuição de chamadas por modelo, para validar se o roteamento funciona.
- Conversas que bateram no teto de orçamento, com motivo.
- Custo por tenant, se houver multitenancy.
Esse último ponto é o que separa uma plataforma de operação de um projeto de IA. Na DOM360 AI, cada ação do agente é evento auditável e faturável, o que permite ligar custo a tenant e a resultado, e não apenas a volume.
Alavancas de redução de custo em agentes de IA
| Alavanca | Redução relatada | Esforço |
|---|---|---|
| Roteamento sistemático de modelos | 30% a 70% | Médio, exige classificar consultas |
| Cascata com 90% em modelos baratos | até 87% | Médio a alto, exige avaliação de qualidade |
| Orçamento de tokens por sessão | Evita cauda de custo | Baixo |
| Contexto enxuto por agente especializado | Proporcional ao prompt cortado | Médio, é decisão de arquitetura |
| Menos turnos por resolução | Token e custo de canal | Baixo a médio, é desenho de conversa |
Perguntas frequentes
Quanto custa uma conversa de agente de IA?
Depende do número de chamadas e do modelo usado. A referência de 2026 é que agentes fazem de 3 a 10 vezes mais chamadas que chatbots simples e que uma tarefa complexa sem restrição pode custar de US$ 5 a 8 apenas em API. Em operação comercial bem roteada, o custo por atendimento fica em ordens de grandeza menores.
Se o token ficou mais barato, por que meu custo aumentou?
Porque o volume de chamadas cresceu mais que a queda de preço. O custo médio por milhão de tokens caiu 67% entre o 1º trimestre de 2025 e o de 2026, mas 73% das empresas ainda estouraram o orçamento, com projetos agênticos passando 2,4 vezes do previsto.
O que é roteamento de modelos?
É classificar cada consulta e enviá-la ao modelo mais barato capaz de resolvê-la, reservando modelos caros para casos difíceis. Organizações com roteamento sistemático relatam redução de 30% a 70%, e cascatas agressivas chegam a 87%.
Como cobrar do cliente final se o custo varia?
Medindo custo por tenant e por evento faturável. Sem essa atribuição, qualquer preço fixo é aposta. Com ela, dá para desenhar preço por conversa, por resultado ou por assinatura com franquia de uso.
Fontes
Dados verificados nas publicações abaixo. Números citados no texto remetem a estas fontes.
Quer ver essa operação rodando no seu negócio?
Vamos mapear onde a IA gera retorno mais rápido e colocar o primeiro agente em operação.
- 1FinOps de tokens: quanto custa cada conversa da sua IA e como controlar
- 2Voz em tempo real: latência abaixo de 1 segundo virou padrão, não diferencial
- 3Comércio agêntico: o que fazer quando a IA do seu cliente é quem compra
- 4WhatsApp passa a cobrar por mensagem em outubro de 2026: o que muda no custo da sua operação


