Calcula el coste de un agente de atención al cliente en banca y la factura de tokens llega al 20-25 por ciento de su coste variable de ejecución. La supervisión humana — expertos funcionales y de riesgos que revisan el trabajo del agente — llega al 70-75 por ciento (McKinsey QuantumBlack, 2026).
El mismo flujo de trabajo. La misma factura. Y casi todos los business cases de agentes que he leído este año optimizan la cifra más pequeña.
Selección del modelo, caché de prompts, un nivel de inferencia más barato para las llamadas de bajo impacto: ahí es donde va la atención técnica, porque ahí es donde el coste es legible. Llega cada mes, desglosado, atribuible. La supervisión llega como horas asalariadas dentro del centro de coste de otra persona, así que nunca se contabiliza como coste del agente de IA. Se contabiliza como la razón por la que el piloto, en silencio, nunca escaló.
Qué calculó realmente McKinsey
La guía de QuantumBlack del 24 de agosto de 2026 sobre la economía de los flujos de trabajo agénticos hace algo que casi todos los análisis de agentes omiten: pone precio al trabajo terminado, no al software. Agentes, sistemas deterministas y las personas que revisan el resultado, todo en una única cifra plenamente cargada.
El caso de referencia es la apertura de cuenta bancaria. El flujo de trabajo emplea de cinco a siete agentes junto a varios sistemas deterministas, con entre dos y cuatro equipos de personas dando supervisión. El coste plenamente cargado por cada onboarding completado cae de aproximadamente 50-150 dólares a unos 10-30 dólares (McKinsey QuantumBlack, 2026).
Es una mejora de tres a cinco veces. Esto no es un argumento de que los agentes no salgan rentables. Es un argumento de que estás siguiendo la partida equivocada para averiguar si los tuyos lo son.
Para dar escala: McKinsey sitúa los flujos de un solo agente de cara al cliente, en algunos bancos, entre 20.000 y 30.000 dólares anuales de operación, y un equipo multiagente entre 100.000 y 200.000 dólares. Esas cifras proceden del análisis de McKinsey sobre investigación pública y precios públicos, no de libros contables auditados de clientes: sujeta con firmeza las proporciones y con holgura las cifras absolutas.
Qué determina realmente el coste de un agente de IA: la tasa de excepción, no el modelo
En el onboarding de clientes bancarios, McKinsey prevé que entre el 10 y el 20 por ciento de las ejecuciones agénticas sea revisado por expertos de riesgos y funcionales.
Esa tasa de revisión es toda la partida, y merece la pena recorrer la aritmética con calma: el ejemplo que sigue es mío, no de McKinsey, pero los datos de entrada son suyos.
Toma un flujo con una tasa de revisión del 15% y 20 minutos de tiempo experto por revisión. En 1.000 ejecuciones son 50 horas de tiempo funcional sénior. Baja la tasa de revisión al 5% y esas mismas 1.000 ejecuciones cuestan unas 17 horas. Has eliminado dos tercios de la partida cara sin tocar un modelo, un prompt ni un contrato con un proveedor.
Y fíjate en quién hace esa revisión. McKinsey especifica expertos funcionales y de riesgos: las personas cuyo criterio el flujo existe para proteger, no un nivel júnior de QA que puedas cubrir barato. El coste de supervisión es alto precisamente porque una supervisión barata no es supervisión; el revisor tiene que ser lo bastante sénior para poder revocar al agente. Cualquier plan que dé por hecho que la capa de revisión puede delegarse hacia abajo es en realidad un plan para dejar de revisar.
Ahora compara eso con la palanca que todo el mundo acciona de verdad. McKinsey identifica solo tres impulsores del coste de tokens: calidad del modelo, requisito de latencia y frecuencia de la tarea. Los precios de frontera a principios de julio de 2026 rondaban los 5 dólares por millón de tokens de entrada y 30 dólares por millón de salida para un modelo de gama alta, frente a 0,20 y 1,25 dólares de un modelo ligero anterior. Una horquilla de veinticinco veces, aplicada a una cuarta parte de la factura.
Y aquí está la trampa dentro de la optimización obvia. Rebajas el modelo para recortar tokens y elevas la tasa de error. Una tasa de error más alta eleva la tasa de excepción. Una tasa de excepción más alta eleva las horas de revisión, que son las tres cuartas partes. El ahorro en tokens financia habitualmente un aumento de supervisión que nadie mide, y el flujo se encarece mientras el panel lo muestra más barato.
Por qué las horas revisadas no desaparecen
Hay evidencia independiente de que la partida de supervisión es estructural y no un problema de madurez que se supera con el tiempo.
MIT Technology Review Insights y Microsoft encuestaron a 300 directivos y profesionales tecnológicos y clasificaron 101 tareas agénticas en una escala de confianza de 0 a 100. La confianza seguía la verificabilidad de la tarea y la completitud del contexto de negocio, no la capacidad del modelo: la generación automatizada de informes obtuvo 83,5 y el código boilerplate 82,5, ambos con una única métrica objetiva de evaluación, mientras que la configuración de service mesh obtuvo 37,5 y las pruebas de recuperación ante desastres 43 — los mismos modelos de base, sin una forma limpia de saber si el resultado era correcto. La rendición de cuentas preocupaba al 48% de los encuestados y las alucinaciones al 47%, y el 59% ya prevé supervisión humana permanente (MIT Technology Review Insights, 2026).
Los datos de producción apuntan en la misma dirección. Un estudio del producto agéntico de Perplexity frente a su producto de búsqueda halló que la finalización de tareas equivalentes bajaba de 269 minutos a 36 — una reducción del 87% en tiempo y del 94% en coste — mientras que el trabajo de seguimiento de los usuarios se desplazaba hacia arriba, hacia la verificación y la extensión (arXiv 2606.07489, 2026).
El trabajo humano se reubica en el paso de revisión. McKinsey es simplemente la primera en poner precio a dónde aterriza.
El volumen y la reutilización deciden si salen las cuentas
La otra mitad de la economía de McKinsey es el coste fijo, y es la mitad que determina si los programas de agentes del mid-market superan el listón.
Un agente conversacional que gestiona el onboarding de 2.500 clientes nuevos al año cuesta 10.000-15.000 dólares. Duplica el volumen y el coste solo sube a 15.000-20.000 dólares, porque la infraestructura de IA y la orquestación de agentes son en gran medida fijas, y los costes fijos se amortizan. Fíjate en qué hay dentro de esa partida de orquestación: capacidad estable de ciencia de datos para mantener el agente en producción, que según observa McKinsey "a menudo necesita ajustes cada dos días".
Los flujos de bajo volumen pierden, por tanto, dos veces. No obtienen amortización sobre el coste fijo, y su ratio de supervisión se mantiene alto porque nunca acumulan suficientes ejecuciones para que alguien detecte los patrones de excepción y los elimine por diseño.
La vía de escape del mid-market es la reutilización, no la escala. Si ningún flujo por sí solo aporta volumen suficiente para amortizar la partida de infraestructura y orquestación, la pregunta pasa a ser cuántos flujos pueden correr sobre una sola construcción de agente: el planteamiento de McKinsey es construir una vez y desplegar en varios flujos. Tres procesos contiguos que compartan un agente, una capa de contexto y un protocolo de revisión superan el listón de coste fijo que ninguno supera por separado. Es una decisión de arquitectura que se toma antes del primer piloto, y resulta muy difícil de aplicar a posteriori una vez que tres equipos han comprado cada uno su propia solución puntual.
Esa asimetría se ve en los datos de adopción. El State of AI 2026 de McKinsey halló que las organizaciones con más de 1.000 millones de dólares de ingresos que escalan agentes pasaron del 27% al 40%, mientras que las de menos de 1.000 millones se quedaron planas en el 22%. En torno al 20% señaló que los costes operativos de la IA limitaban su uso, y la proporción que atribuye a la IA al menos algún impacto en el EBIT se mantuvo en el 37%, sin cambios interanuales (McKinsey, 2026).
La adopción se acumula. El impacto financiero declarado no. Esa es la firma de una partida de coste que nadie está gestionando.
La objeción honesta: esto es banca, y es una estimación
Dos salvedades que conviene que oigas de mí y no de tu director financiero.
Primera, la cifra del 70-75% procede de servicios financieros regulados y de cara al cliente. La intensidad de la supervisión es función de la exposición regulatoria y de la consecuencia del error. La clasificación interna de tickets en una empresa de logística de 200 personas está en otra curva, y allí el reparto puede estar más cerca del equilibrio.
Segunda, son costes modelizados sobre precios públicos e investigación pública, no libros medidos en un encargo con cliente. Trátalos como una estimación bien especificada, no como una medición.
Pero observa hacia dónde se inclina el error. Los precios de los tokens han bajado de forma sostenida y seguirán bajando. Los salarios de los revisores no lo han hecho ni lo harán. Cada mes que pasa desplaza la proporción aún más en contra de los tokens, no de vuelta hacia ellos. Si el 70-75% es incorrecto para tu contexto hoy, la corrección honesta es preguntar en qué se convierte dentro de dieciocho meses, no suponer que volverá a caer hacia algo que el panel de tokens sí puede ver.
Pon precio a las horas de revisión antes de aprobar el piloto
Cinco cosas que cambiar en cómo evalúas la próxima propuesta de agente.
- Mete la tasa de excepción en el business case como una cifra explícita. Porcentaje de ejecuciones que requieren revisión humana, minutos previstos por revisión, coste horario cargado del revisor. Si nadie se compromete con esas tres cifras, no tienes un business case: tienes una demo con un presupuesto grapado.
- Construye la verificabilidad antes de ampliar el alcance. La clasificación MIT–Microsoft muestra que la confianza sigue a las tareas con una única métrica de éxito legible. Esa propiedad es construible: instrumenta la métrica, codifica el contexto de negocio, estrecha el alcance. Secuencia los despliegues por verificabilidad, no por qué tarea parece más simple.
- Ordena los flujos candidatos primero por número de ejecuciones anuales. La reutilización y el volumen son lo que amortiza el coste fijo. Un caso de uso ingenioso de bajo volumen es peor inversión que uno aburrido de alto volumen, siempre.
- Presupuesta la partida de mantenimiento de forma explícita. Agentes ajustados cada dos días exigen capacidad de ingeniería permanente. Es un coste fijo duradero, no un gasto de proyecto.
- Reporta el ROI del trabajo terminado. Coste plenamente cargado para completar el trabajo — personas, agentes y sistemas deterministas juntos — medido contra el valor del trabajo. No coste por token, ni horas teóricamente ahorradas.
La receta de la propia McKinsey es la inversa del instinto: en lugar de optimizar la selección del modelo, rediseña el flujo para recortar las tasas de excepción y simplificar los procesos de revisión que disparan la costosa intervención humana. Es un mandato de ingeniería de procesos alojado en lo que todos han tratado como una decisión de compras.
Qué decidir este trimestre
Busca el piloto de agentes que espera tu firma y pide una cifra que no está en la presentación: horas de revisión previstas por cada cien ejecuciones.
Si la respuesta es un encogimiento de hombros, no te están pidiendo que apruebes un software. Te están pidiendo que dotes de personal a un equipo de revisión que nadie ha presupuestado — y que lo hagas sobre las tres cuartas partes del coste de un agente de IA que tu panel nunca se construyó para enseñarte.