Custos

FinOps de tokens: quanto custa cada conversa da sua IA e como controlar

Equipe DOM360 9 min de leitura atualizado em
resposta direta

O preço do token caiu, mas o custo total de IA subiu porque agentes fazem muito mais chamadas por tarefa, e o controle vem de roteamento de modelos, orçamento por sessão e atribuição de custo por agente.

resumo // tl;dr

Duas coisas verdadeiras ao mesmo tempo: o custo médio de token caiu 67% entre o primeiro trimestre de 2025 e o de 2026, de US$ 18,40 para US$ 6,07 por milhão de tokens, e ainda assim 73% das empresas estouraram o plano de custo de IA, com projetos agênticos passando 2,4 vezes do orçamento. O motivo é volume: agentes fazem de 3 a 10 vezes mais chamadas que um chatbot simples. Quem controla trata custo como requisito de engenharia, com roteamento de modelos, que reduz de 30% a 70%, e cascata bem feita, que chega a 87%.

Pontos-chave

  • O custo médio combinado de token caiu 67% entre o 1º trimestre de 2025 e o 1º de 2026, de US$ 18,40 para US$ 6,07 por milhão.
  • 73% das empresas excederam o plano original de custo de IA e projetos agênticos estouraram o orçamento por um fator de 2,4.
  • Agentes fazem de 3 a 10 vezes mais chamadas de modelo que chatbots simples; uma tarefa complexa sem limite pode custar de US$ 5 a 8 só em API.
  • Roteamento sistemático de modelos gera redução de custo relatada entre 30% e 70%.
  • Cascata que envia 90% das consultas a modelos mais baratos e reserva o modelo caro para o que é realmente difícil pode chegar a 87% de redução.

Por que a conta de IA sobe se o token está mais barato?#

Porque preço unitário e custo total são coisas diferentes. O custo médio combinado de token caiu 67% entre o primeiro trimestre de 2025 e o primeiro de 2026, de US$ 18,40 para US$ 6,07 por milhão de tokens. Mesmo assim, 73% das empresas excederam o plano original de custo, e projetos agênticos estouraram o orçamento por um fator de 2,4.

A explicação está na mudança de padrão de uso. Um chatbot faz uma chamada por pergunta. Um agente faz muitas: entende o pedido, decide a ação, chama ferramenta, avalia o retorno, decide de novo. Isso resulta em 3 a 10 vezes mais chamadas por interação. Uma tarefa complexa sem restrição pode chegar a US$ 5 a 8 apenas em taxa de API.

Há registro de crescimento de 30 vezes em consultas agênticas em seis meses em operações grandes. Quando o volume multiplica assim, queda de preço unitário não salva ninguém.

Em 2026, custo de IA é requisito de engenharia, no mesmo nível de latência e confiabilidade.

Qual a unidade de custo que importa em uma operação comercial?#

Não é custo por token. Ninguém no comercial toma decisão com custo por token. As unidades que sustentam decisão são:

  • Custo por conversa: quanto custa um atendimento completo, do primeiro contato à resolução.
  • Custo por resultado: quanto custa uma negociação fechada, um lead qualificado, um chamado resolvido.
  • Custo por tenant: quanto consome cada cliente, unidade ou parceiro de revenda, se você opera multitenancy.

A boa prática de 2026 é que a atribuição de custo desceu da fatura de nuvem para o token, e do token para a execução individual do agente e a sessão. Sem isso, você descobre o problema no fim do mês.

Para quem revende ou opera white label, custo por tenant não é refinamento: é o que define se o modelo de precificação fecha.

Como reduzir custo sem piorar a qualidade?#

Quatro alavancas, da mais eficaz para a mais sutil:

  1. Roteamento de modelos. Nem toda pergunta precisa do modelo mais caro. Organizações com roteamento sistemático relatam redução de 30% a 70%. Uma cascata bem feita, que envia 90% das consultas a modelos mais baratos e reserva o modelo caro para o que é genuinamente difícil, chega a 87% de redução.
  2. Orçamento de tokens por sessão. Definir teto por conversa evita o caso patológico do agente que entra em laço e consome dezenas de chamadas.
  3. Contexto enxuto. Enviar a política comercial inteira em cada chamada é o desperdício mais comum. Agentes especializados, com escopo estreito, carregam menos contexto por chamada.
  4. Resolver em menos turnos. Isso reduz token e, a partir de outubro de 2026, reduz também custo de mensagem no WhatsApp. Vale dobrado.

Note que três das quatro alavancas são arquiteturais, não de negociação com fornecedor. É por isso que a camada de orquestração define o custo mais do que o preço de tabela do modelo.

O que colocar no painel semanal de custo?#

Um painel útil de FinOps de IA em operação comercial tem seis linhas, não sessenta:

  • Custo total do período e variação contra o período anterior.
  • Custo por conversa, com mediana e cauda (as conversas mais caras revelam laços e falhas).
  • Custo por resultado de negócio, por operação.
  • Distribuição de chamadas por modelo, para validar se o roteamento funciona.
  • Conversas que bateram no teto de orçamento, com motivo.
  • Custo por tenant, se houver multitenancy.

Esse último ponto é o que separa uma plataforma de operação de um projeto de IA. Na DOM360 AI, cada ação do agente é evento auditável e faturável, o que permite ligar custo a tenant e a resultado, e não apenas a volume.

Alavancas de redução de custo em agentes de IA

AlavancaRedução relatadaEsforço
Roteamento sistemático de modelos30% a 70%Médio, exige classificar consultas
Cascata com 90% em modelos baratosaté 87%Médio a alto, exige avaliação de qualidade
Orçamento de tokens por sessãoEvita cauda de custoBaixo
Contexto enxuto por agente especializadoProporcional ao prompt cortadoMédio, é decisão de arquitetura
Menos turnos por resoluçãoToken e custo de canalBaixo a médio, é desenho de conversa

Perguntas frequentes

Quanto custa uma conversa de agente de IA?

Depende do número de chamadas e do modelo usado. A referência de 2026 é que agentes fazem de 3 a 10 vezes mais chamadas que chatbots simples e que uma tarefa complexa sem restrição pode custar de US$ 5 a 8 apenas em API. Em operação comercial bem roteada, o custo por atendimento fica em ordens de grandeza menores.

Se o token ficou mais barato, por que meu custo aumentou?

Porque o volume de chamadas cresceu mais que a queda de preço. O custo médio por milhão de tokens caiu 67% entre o 1º trimestre de 2025 e o de 2026, mas 73% das empresas ainda estouraram o orçamento, com projetos agênticos passando 2,4 vezes do previsto.

O que é roteamento de modelos?

É classificar cada consulta e enviá-la ao modelo mais barato capaz de resolvê-la, reservando modelos caros para casos difíceis. Organizações com roteamento sistemático relatam redução de 30% a 70%, e cascatas agressivas chegam a 87%.

Como cobrar do cliente final se o custo varia?

Medindo custo por tenant e por evento faturável. Sem essa atribuição, qualquer preço fixo é aposta. Com ela, dá para desenhar preço por conversa, por resultado ou por assinatura com franquia de uso.

Fontes

Dados verificados nas publicações abaixo. Números citados no texto remetem a estas fontes.

  1. AI Agent Cost Optimization: Token Budgets, Model Routing, and Production FinOps Zylos Research
  2. AI Agent Cost Optimization: Token Economics and FinOps in Production Zylos Research
  3. FinOps X 2026 Recap: AI Tokenomics Explained Mavvrik
  4. Token FinOps 2026: Getting AI Costs Under Control Innobu

Quer ver essa operação rodando no seu negócio?

Vamos mapear onde a IA gera retorno mais rápido e colocar o primeiro agente em operação.

trilha de leituraCanais e custosparte 1 de 4
  1. 1FinOps de tokens: quanto custa cada conversa da sua IA e como controlar
  2. 2Voz em tempo real: latência abaixo de 1 segundo virou padrão, não diferencial
  3. 3Comércio agêntico: o que fazer quando a IA do seu cliente é quem compra
  4. 4WhatsApp passa a cobrar por mensagem em outubro de 2026: o que muda no custo da sua operação
próximo artigo Agente de IA para cobrança e renegociação: como funciona a recuperação de crédito pelo WhatsApp ler →