Calcule o custo de um agente de atendimento ao cliente no setor bancário e a conta de tokens chega a 20 a 25 por cento do seu custo variável de operação. A supervisão humana — especialistas funcionais e de risco que revisam o trabalho do agente — chega a 70 a 75 por cento (McKinsey QuantumBlack, 2026).
O mesmo fluxo de trabalho. A mesma fatura. E praticamente todo business case de agentes que li este ano otimiza o menor dos dois números.
Seleção de modelo, cache de prompts, uma camada de inferência mais barata para chamadas de baixo risco: é para lá que vai a atenção de engenharia, porque é lá que o custo é legível. Ele chega mensalmente, discriminado, atribuível. A supervisão chega como horas de salário dentro do centro de custo de outra pessoa e, por isso, nunca é contabilizada como custo do agente de IA. É contabilizada como o motivo pelo qual o piloto, silenciosamente, nunca ganhou escala.
O que a McKinsey realmente precificou
O guia da QuantumBlack de 24 de agosto de 2026 sobre a economia dos fluxos de trabalho agênticos faz algo que quase todas as análises de agentes pulam: precifica o trabalho concluído, não o software. Agentes, sistemas determinísticos e as pessoas que revisam o resultado, tudo em um único número totalmente carregado.
O caso central é a abertura de conta bancária. O fluxo emprega de cinco a sete agentes ao lado de múltiplos sistemas determinísticos, com dois a quatro times de pessoas fazendo supervisão. O custo totalmente carregado por onboarding concluído cai de cerca de US$ 50-150 para cerca de US$ 10-30 (McKinsey QuantumBlack, 2026).
É uma melhoria de três a cinco vezes. Isto não é um argumento de que agentes não se pagam. É um argumento de que você está acompanhando a rubrica errada para descobrir se os seus se pagam.
Para dar escala: a McKinsey situa fluxos de agente único voltados ao cliente, em alguns bancos, entre US$ 20.000 e US$ 30.000 por ano de operação, e um time multiagente entre US$ 100.000 e US$ 200.000. Esses números vêm da análise da McKinsey sobre pesquisa pública e preços públicos, não de livros contábeis auditados de clientes — segure as proporções com firmeza e os valores absolutos com folga.
O que realmente determina o custo de um agente de IA: a taxa de exceção, não o modelo
No onboarding de clientes bancários, a McKinsey espera que 10 a 20 por cento das execuções agênticas sejam revisadas por especialistas de risco e funcionais.
Essa taxa de revisão é o jogo inteiro, e vale a pena percorrer a aritmética com calma — a ilustração a seguir é minha, não da McKinsey, mas os insumos são deles.
Considere um fluxo com taxa de revisão de 15% e 20 minutos de tempo de especialista por revisão. Em 1.000 execuções, são 50 horas de tempo funcional sênior. Reduza a taxa de revisão para 5% e as mesmas 1.000 execuções custam cerca de 17 horas. Você removeu dois terços da rubrica cara sem tocar em um modelo, em um prompt ou em um contrato de fornecedor.
E repare em quem faz essa revisão. A McKinsey especifica especialistas funcionais e de risco — as pessoas cujo julgamento o fluxo existe para proteger, não uma camada júnior de QA que se possa alocar barato. O custo de supervisão é alto justamente porque supervisão barata não é supervisão; o revisor precisa ser sênior o bastante para poder contrariar o agente. Qualquer plano que assuma que a camada de revisão pode ser delegada para baixo é, na prática, um plano para parar de revisar.
Agora compare isso com a alavanca que todo mundo de fato puxa. A McKinsey identifica apenas três motores do custo de tokens: qualidade do modelo, exigência de latência e frequência da tarefa. Os preços de fronteira no início de julho de 2026 giravam em torno de US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de saída para um modelo de ponta, contra US$ 0,20 e US$ 1,25 de um modelo leve anterior. Uma amplitude de vinte e cinco vezes — aplicada a um quarto da conta.
E aqui está a armadilha dentro da otimização óbvia. Rebaixe o modelo para cortar tokens e você eleva a taxa de erro. Uma taxa de erro maior eleva a taxa de exceção. Uma taxa de exceção maior eleva as horas de revisão, que são os três quartos. A economia em tokens rotineiramente financia um aumento de supervisão que ninguém mede, e o fluxo fica mais caro enquanto o painel mostra que ficou mais barato.
Por que as horas revisadas não desaparecem
Há evidência independente de que a rubrica de supervisão é estrutural, e não um problema de maturidade que se supera com o tempo.
A MIT Technology Review Insights e a Microsoft entrevistaram 300 executivos e profissionais de tecnologia e classificaram 101 tarefas agênticas numa escala de confiança de 0 a 100. A confiança acompanhou a verificabilidade da tarefa e a completude do contexto de negócio, não a capacidade do modelo: geração automatizada de relatórios marcou 83,5 e código boilerplate 82,5, ambos com uma única métrica objetiva de avaliação, enquanto configuração de service mesh marcou 37,5 e testes de recuperação de desastres 43 — os mesmos modelos subjacentes, sem um jeito limpo de saber se o resultado estava certo. Responsabilização preocupava 48% dos respondentes e alucinações 47%, e 59% já planejam supervisão humana permanente (MIT Technology Review Insights, 2026).
Os dados de produção apontam na mesma direção. Um estudo do produto agêntico da Perplexity contra seu produto de busca constatou que a conclusão de tarefas equivalentes caiu de 269 minutos para 36 — uma redução de 87% no tempo e de 94% no custo — enquanto o trabalho de acompanhamento feito pelos usuários se deslocava para cima, para verificação e extensão (arXiv 2606.07489, 2026).
O trabalho humano se realoca para a etapa de revisão. A McKinsey é simplesmente a primeira a colocar preço em onde ele aterrissa.
Volume e reúso decidem se a conta fecha
A outra metade da economia da McKinsey é o custo fixo, e é a metade que determina se os programas de agentes do mid-market superam o limiar.
Um agente conversacional que faz o onboarding de 2.500 novos clientes por ano custa US$ 10.000-15.000. Dobre o volume e o custo sobe apenas para US$ 15.000-20.000 — porque infraestrutura de IA e orquestração de agentes são majoritariamente fixas, e custos fixos se amortizam. Note o que há dentro dessa rubrica de orquestração: capacidade permanente de ciência de dados para manter o agente em produção, que, observa a McKinsey, "muitas vezes precisa ser ajustado a cada dois dias".
Fluxos de baixo volume, portanto, perdem duas vezes. Não obtêm amortização sobre o custo fixo, e sua razão de supervisão permanece alta porque nunca acumulam execuções suficientes para alguém identificar os padrões de exceção e eliminá-los por design.
A saída para o mid-market é reúso, não escala. Se nenhum fluxo isolado carrega volume suficiente para amortizar a rubrica de infraestrutura e orquestração, a pergunta passa a ser quantos fluxos podem rodar sobre uma única construção de agente — o enquadramento da McKinsey é construir uma vez e implantar em vários fluxos. Três processos adjacentes compartilhando um agente, uma camada de contexto e um protocolo de revisão superam o limiar de custo fixo que nenhum deles supera sozinho. Essa é uma decisão de arquitetura tomada antes do primeiro piloto, e é muito difícil de aplicar depois que três times já compraram cada um a sua solução pontual.
Essa assimetria aparece nos dados de adoção. O State of AI 2026 da McKinsey constatou que organizações acima de US$ 1 bilhão de receita escalando agentes subiram de 27% para 40%, enquanto organizações abaixo de US$ 1 bilhão ficaram estáveis em 22%. Cerca de 20% relataram que os custos operacionais de IA limitaram seu uso, e a parcela que atribui à IA ao menos algum impacto no EBIT ficou em 37%, inalterada ano a ano (McKinsey, 2026).
A adoção se acumula. O impacto financeiro reportado, não. Essa é a assinatura de uma rubrica de custo que ninguém está gerindo.
O contraponto honesto: isto é setor bancário, e é uma estimativa
Duas ressalvas que é melhor você ouvir de mim do que do seu CFO.
Primeira, o número de 70-75% vem de serviços financeiros regulados e voltados ao cliente. A intensidade da supervisão é função da exposição regulatória e da consequência do erro. A triagem interna de chamados numa empresa de logística de 200 pessoas está em outra curva, e ali a divisão pode estar mais perto do meio a meio.
Segunda, são custos modelados sobre preços públicos e pesquisa pública, não livros medidos em um projeto com cliente. Trate-os como uma estimativa bem especificada, não como uma medição.
Mas observe para que lado corre o erro. Os preços dos tokens vêm caindo de forma consistente e vão continuar caindo. Os salários dos revisores não caíram e não cairão. Cada mês que passa move a razão ainda mais contra os tokens, não de volta a eles. Se 70-75% está errado para o seu contexto hoje, a correção honesta é perguntar no que isso se transforma em dezoito meses — e não presumir que volta para algo que o painel de tokens consegue enxergar.
Precifique as horas de revisão antes de aprovar o piloto
Cinco coisas a mudar na forma como você avalia a próxima proposta de agentes.
- Coloque a taxa de exceção no business case como um número nomeado. Percentual de execuções que exigem revisão humana, minutos esperados por revisão, custo horário carregado do revisor. Se ninguém se compromete com esses três números, você não tem um business case: tem uma demo com um orçamento grampeado.
- Engenhe a verificabilidade antes de ampliar o escopo. O ranking MIT–Microsoft mostra que a confiança segue tarefas com uma única métrica de sucesso legível. Essa propriedade é construível: instrumente a métrica, codifique o contexto de negócio, estreite o escopo. Sequencie implantações por verificabilidade, não por qual tarefa parece mais simples.
- Classifique os fluxos candidatos primeiro pelo número anual de execuções. Reúso e volume são o que amortiza o custo fixo. Um caso de uso engenhoso de baixo volume é um investimento pior do que um caso chato de alto volume, sempre.
- Orce a rubrica de manutenção explicitamente. Agentes ajustados a cada dois dias exigem capacidade permanente de engenharia. Isso é custo fixo permanente, não despesa de projeto.
- Reporte o ROI do trabalho concluído. Custo totalmente carregado para terminar o trabalho — pessoas, agentes e sistemas determinísticos juntos — medido contra o valor do trabalho. Não custo por token, nem horas teoricamente economizadas.
A prescrição da própria McKinsey é o inverso do instinto: em vez de otimizar a seleção do modelo, redesenhe o fluxo para cortar taxas de exceção e simplificar os processos de revisão que disparam a custosa intervenção humana. É um mandato de engenharia de processos alojado naquilo que todos vinham tratando como decisão de compras.
O que decidir neste trimestre
Encontre o piloto de agentes que aguarda a sua assinatura e peça um número que não está na apresentação: horas de revisão esperadas por cem execuções.
Se a resposta for um dar de ombros, não estão pedindo que você aprove um software. Estão pedindo que você monte um time de revisão que ninguém orçou — e que faça isso sobre os três quartos do custo de um agente de IA que o seu painel nunca foi construído para mostrar.