L'étude NANDA du MIT a constaté que 95% des pilotes d'IA générative ne produisent aucun retour mesurable. Dans le GCC, 63% des organisations en sont encore au stade pré-implémentation. La contrainte n'a jamais été le modèle. C'est là où le travail attend.
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
Deux chiffres décrivent le même écart depuis deux côtés différents. L’étude State of AI in Business de MIT NANDA a passé en revue plus de 300 initiatives d’IA en entreprise et a constaté qu’environ 95% n’ont produit aucun effet mesurable sur le compte de résultat. Et l’enquête de Deloitte dans le GCC auprès de dirigeants financiers et fiscaux a constaté que plus de 63% des organisations de la région en sont encore aux stades pré-implémentation, avec seulement 9% qui passent quelque chose à l’échelle.
La lecture confortable est que la technologie n’est pas prête. Les faits disent le contraire. Lisez les échecs de près et presque aucun n’est un échec de production. Les systèmes ont généré les synthèses, les brouillons, les classifications, et les ont bien générés. Ils étaient braqués sur la mauvaise contrainte.
Les pilotes n’ont pas échoué sur la production
Les chercheurs de NANDA ont interrogé 52 organisations et sondé 153 dirigeants. Le motif derrière les 95% n’était pas des modèles défaillants. C’étaient des systèmes qui n’ont jamais touché le chiffre auquel tenait le commanditaire. Forte adoption, faible transformation : sept secteurs sur neuf ont montré ce que le rapport appelle une expérimentation généralisée sans changement structurel.
Cette distinction compte parce qu’elle change à qui revient la correction. Un problème de capacité appartient au fournisseur et se règle dans une future version du modèle. Un problème de déploiement appartient à celui qui a choisi quoi automatiser. Dans 95% des cas, ce choix a décidé du résultat. Le modèle n’a jamais eu voix au chapitre.
Automatiser l’étape qui attendait déjà
Prenez un motif reconnaissable dans une dizaine d’entreprises. Une fonction achats déploie un modèle pour produire des synthèses de risque fournisseur, ramenant une tâche d’analyste de deux jours à vingt minutes. Le gain est réel et proprement mesuré. Le débit de contrats fournisseurs signés ne bouge pas d’un cran, parce que la contrainte véritable était une file d’attente de revue juridique qui tournait à six semaines.
L’organisation a automatisé l’étape qui attendait déjà l’étape qu’elle n’a pas touchée. Le gain était réel, et la file l’a entièrement absorbé.
La conséquence pratique pour n’importe quel conseil d’administration : cessez de demander quelles tâches un modèle pourrait faire. Demandez où le travail attend aujourd’hui, et combien de temps. Si le modèle ne touche pas la file la plus longue, le business case est un exercice comptable. Mesurez les temps d’attente avant d’approuver le pilote, pas après qu’il a déçu.
Quand tout le monde consulte le même oracle, les erreurs cessent de s’annuler
Un groupe ne dépasse son membre moyen que si les erreurs de ses membres sont indépendantes. Corrélez les erreurs et le consensus devient collectivement et sûrement faux, avec tout le réconfort de l’accord et rien de sa substance.
L’IA d’entreprise corrèle les erreurs par construction. La plupart des déploiements sérieux reposent sur une poignée de modèles de pointe. Au sein d’une même entreprise, la recherche documentaire tourne sur un seul corpus, à travers un seul gabarit de prompt, maintenu par une seule équipe plateforme. Cinq analystes qui consultent cette pile ne sont pas cinq analystes. Ce sont un analyste, échantillonné cinq fois.
La parade est peu spectaculaire et bon marché : gardez un bras de contrôle vivant. Faites passer 5 à 10% des décisions conséquentes par un jugement humain non assisté, en permanence, et non en audit ponctuel. Quand les populations assistée et non assistée divergent, vous avez trouvé soit une défaillance du modèle, soit une défaillance humaine. Les deux méritent d’être connues, et les divergences sont rarement là où on les attendait.
Un jugement non signé n’est pas un contrôle
La sortie d’un modèle arrive orpheline. Un paragraphe rédigé par un modèle et un paragraphe argumenté se ressemblent trait pour trait dans la note finale. Le relecteur ne peut pas dire quelles phrases quelqu’un défendrait sous questions et lesquelles ont simplement survécu à une lecture rapide. La responsabilité s’érode un paragraphe non attribué à la fois, jusqu’à ce que personne dans la chaîne ne puisse dire qui a réellement cru le chiffre.
Trois champs règlent l’essentiel, appliqués à chaque jugement issu d’un modèle qui atteint un décideur : qui répond de son exactitude, quel contexte l’a produit, et une ligne sur ce qui ferait changer d’avis. Ensuite, stockez le jugement plutôt que de le régénérer à la demande. Un jugement stocké a un auteur et une date. Un jugement régénéré est différent à chaque fois qu’on le demande, ne répond devant personne, et vous refacture à chaque consultation.
C’est la même discipline qui rend un agent auditable en premier lieu. L’argument est ici : pourquoi les agents d’IA trichent, et la gouvernance qui tient vraiment.
Ce que la pré-implémentation coûte réellement à Dubaï
Les 63% du GCC ne sont pas un retard technologique. Les dirigeants de la région s’attendent à ce que l’IA compte : 93% dans la même enquête Deloitte prévoient un impact organisationnel significatif. L’écart se situe entre le mandat et le premier système qui fonctionne, et c’est exactement là que se reproduit le motif d’échec des 95% : évaluations longues, cadres larges, pilotes cadrés pour démontrer une thèse plutôt que pour faire bouger une file.
La sortie, c’est un périmètre étroit avec une base de référence mesurée. Un processus, un responsable, une file que vous pouvez chronométrer avant et après. Un système qui prend en charge une vraie part de travail avant la fin d’une journée est un fait qu’aucune présentation de stratégie ne peut contester, et c’est le seul type de preuve qui sort une organisation des 63%.
Choisissez le processus où le travail attend le plus longtemps, et commencez là. Une journée clinique prend l’un de vos processus, construit un agent qui fonctionne dessus, et vous laisse l’avant-après mesuré le soir même, l’anti-motif des 95%. Si le cimetière de pilotes est déjà plein, la méthode de conseil en cinq étapes commence par trouver la file, pas le cas d’usage.
Frequently asked questions
Why do 95% of AI pilots fail to show ROI?+
MIT NANDA's 2025 study of over 300 enterprise AI initiatives found the failures were rarely failures of output. The systems generated good summaries, drafts, and classifications. They were pointed at the wrong constraint: automating steps that were already waiting on a slower queue elsewhere, so the gain was absorbed before it reached the P&L.
What should we measure before approving an AI pilot?+
Measure where work waits, and for how long, before approving the pilot, not after it disappoints. If the AI does not touch the longest queue in the process, the business case is an accounting exercise. Wait times, not task times, predict whether throughput will move.
How many GCC organisations are still pre-implementation on AI?+
Deloitte's 2025 survey of senior tax and finance leaders across Saudi Arabia, the UAE, Qatar, and Kuwait found more than 63% of GCC organisations remain in pre-implementation stages. Only 9% have begun scaling solutions.

