ARKONE
A long queue of paper trays on an office desk, one tray overflowing

Por qué el 95% de los pilotos de IA nunca llegan a la cuenta de resultados

August 9, 2026 · 5 min read

S
Sobin George Thomas

El estudio NANDA del MIT encontró que el 95% de los pilotos de IA generativa no producen ningún retorno medible. En el GCC, el 63% de las organizaciones siguen en fase previa a la implantación. La restricción nunca fue el modelo. Es donde el trabajo espera.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

Dos cifras describen la misma brecha desde lados distintos. El estudio State of AI in Business de MIT NANDA revisó más de 300 iniciativas de IA empresarial y encontró que aproximadamente el 95% no produjo ningún efecto medible sobre la cuenta de resultados. Y la encuesta de Deloitte en el GCC a directivos senior de finanzas y fiscalidad encontró que más del 63% de las organizaciones de la región siguen en fases previas a la implantación, y solo un 9% está escalando algo.

La lectura cómoda es que la tecnología no está lista. La evidencia dice lo contrario. Lea los fracasos de cerca y casi ninguno es un fracaso de output. Los sistemas generaron los resúmenes, los borradores, las clasificaciones, y los generaron bien. Estaban apuntando a la restricción equivocada.


Los pilotos no fracasaron en el output

Los investigadores de NANDA entrevistaron a 52 organizaciones y encuestaron a 153 directivos senior. El patrón detrás del 95% no eran modelos rotos. Eran sistemas que nunca tocaron la cifra que le importaba al patrocinador. Alta adopción, baja transformación: siete de nueve industrias mostraron lo que el informe llama experimentación generalizada sin cambio estructural.

Esa distinción importa porque cambia a quién le corresponde la solución. Un problema de capacidad es del proveedor y se resuelve en una futura versión del modelo. Un problema de despliegue es de quien eligió qué automatizar. En el 95% de los casos, esa elección decidió el resultado. El modelo nunca tuvo voto.


Automatizar el paso que ya estaba esperando

Considere un patrón reconocible en una docena de empresas. Una función de compras despliega un modelo para producir resúmenes de riesgo de proveedores, reduciendo una tarea de analista de dos días a veinte minutos. El ahorro es real y se mide con limpieza. El volumen de contratos de proveedor firmados no se mueve en absoluto, porque la restricción vinculante era una cola de revisión legal que corría a seis semanas.

La organización automatizó el paso que ya estaba esperando al paso que no tocó. La ganancia fue real, y la cola la absorbió entera.

La consecuencia práctica para cualquier consejo: dejen de preguntar qué tareas podría hacer un modelo. Pregunten dónde espera hoy el trabajo, y cuánto tiempo. Si el modelo no toca la cola más larga, el business case es un ejercicio contable. Midan los tiempos de espera antes de aprobar el piloto, no después de que decepcione.


Cuando todos consultan el mismo oráculo, los errores dejan de cancelarse

Un grupo supera a su miembro medio solo cuando los errores de sus miembros son independientes. Correlacione los errores y el consenso se vuelve confiada y colectivamente erróneo, con toda la tranquilidad del acuerdo y nada de su sustancia.

La IA empresarial correlaciona errores por diseño. La mayoría de los despliegues serios se apoyan en un puñado de modelos frontera. Dentro de una misma empresa, la recuperación corre sobre un corpus documental, a través de una plantilla de prompt, mantenida por un equipo de plataforma. Cinco analistas consultando ese stack no son cinco analistas. Son un analista, muestreado cinco veces.

La contramedida es poco vistosa y barata: mantenga un grupo de control vivo. Enrute entre el 5 y el 10% de las decisiones de consecuencia por juicio humano sin asistencia, de forma permanente, no como auditoría puntual. Cuando las poblaciones asistida y no asistida diverjan, habrá encontrado o un fallo del modelo o uno humano. Ambos merecen conocerse, y las divergencias rara vez están donde alguien esperaba.


Un juicio sin firma no es un control

El output de un modelo llega huérfano. Un párrafo redactado por un modelo y uno argumentado se ven idénticos en el memorando terminado. El revisor no puede distinguir qué frases alguien defendería bajo preguntas y cuáles simplemente sobrevivieron a una lectura rápida. La rendición de cuentas se degrada un párrafo sin atribuir cada vez, hasta que nadie en la cadena puede decir quién creyó realmente la cifra.

Tres campos arreglan la mayor parte, aplicados a cada juicio derivado de un modelo que llega a quien decide: quién responde de que esto sea correcto, qué contexto lo produjo, y una línea sobre qué le haría cambiar de opinión. Después, almacene el juicio en lugar de regenerarlo bajo demanda. Un juicio almacenado tiene autor y fecha. Uno regenerado es distinto cada vez que se pide, no responde ante nadie, y le vuelve a facturar en cada visualización.

Esta es la misma disciplina que hace auditable a un agente en primer lugar. El argumento está en por qué los agentes de IA hacen trampa, y la gobernanza que sí aguanta.


Lo que la fase previa a la implantación cuesta de verdad en Dubái

El 63% del GCC no es un retraso tecnológico. Los líderes de la región esperan que la IA importe: un 93% en la misma encuesta de Deloitte prevé un impacto organizativo significativo. La brecha se sitúa entre el mandato y el primer sistema que funciona, y es exactamente donde se cría el patrón de fracaso del 95%: evaluaciones largas, marcos amplios, pilotos definidos para demostrar una tesis en vez de mover una cola.

La salida es alcance estrecho con una línea base medida. Un proceso, un responsable, una cola que pueda cronometrar antes y después. Un sistema que se hace cargo de una pieza real de trabajo al final de un día es un dato con el que ninguna presentación de estrategia puede discutir, y es la única clase de evidencia que saca a una organización del 63%.


Elija el proceso donde el trabajo espera más tiempo, y empiece ahí. Un día de clínica toma uno de sus procesos, construye un agente que funciona sobre él, y le deja el antes y el después medidos para la tarde: el antipatrón del 95%. Si el cementerio de pilotos ya está lleno, el método de consultoría en cinco pasos empieza por encontrar la cola, no el caso de uso.

Frequently asked questions

Why do 95% of AI pilots fail to show ROI?+

MIT NANDA's 2025 study of over 300 enterprise AI initiatives found the failures were rarely failures of output. The systems generated good summaries, drafts, and classifications. They were pointed at the wrong constraint: automating steps that were already waiting on a slower queue elsewhere, so the gain was absorbed before it reached the P&L.

What should we measure before approving an AI pilot?+

Measure where work waits, and for how long, before approving the pilot, not after it disappoints. If the AI does not touch the longest queue in the process, the business case is an accounting exercise. Wait times, not task times, predict whether throughput will move.

How many GCC organisations are still pre-implementation on AI?+

Deloitte's 2025 survey of senior tax and finance leaders across Saudi Arabia, the UAE, Qatar, and Kuwait found more than 63% of GCC organisations remain in pre-implementation stages. Only 9% have begun scaling solutions.

¿Listo para iniciar una conversación?

Descubra cómo ArkOne diseña la gobernanza y la arquitectura de programas para generar retornos medibles con IA.

Agende una llamada exploratoria