MITのNANDA調査は、生成AIパイロットの95%が測定可能な事業成果を生んでいないことを明らかにした。GCCでは63%の組織がいまだ導入前の段階にある。制約はモデルではなかった。制約は、仕事がどこで待たされているかにある。
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
二つの数字が、同じ隔たりを別々の側から描いている。MIT NANDAのState of AI in Business調査は300件を超える企業のAI施策を精査し、およそ95%が損益計算書に測定可能な影響を与えていないことを見出した。そしてDeloitteによるGCC調査では、財務・税務の上級責任者のうち、域内組織の63%超がいまだ導入前の段階にあり、何かを本格展開できているのはわずか9%だった。
都合のよい解釈は、技術がまだ成熟していないというものだ。証拠はそう言っていない。失敗例を丁寧に読むと、出力の失敗はほとんどない。システムは要約も、下書きも、分類も生成した。しかも十分な品質で生成した。ただ、向けられていた制約が間違っていた。
パイロットは出力で失敗したのではない
NANDAの研究者は52の組織に聞き取りを行い、153名の上級責任者に調査した。95%の背後にあったパターンは、壊れたモデルではない。出資者が気にかけていた数字に一度も触れなかったシステムだ。導入は進み、変革は進まない。九つの業界のうち七つで、報告書が言うところの「構造的変化を伴わない広範な実験」が見られた。
この区別が重要なのは、誰が直すべきかが変わるからだ。能力の問題はベンダーのものであり、将来のモデル更新で解消する。導入の問題は、何を自動化するかを選んだ側のものだ。95%のケースでは、その選択が結果を決めていた。モデルには投票権すらなかった。
すでに待たされていた工程を自動化する
多くの企業で見覚えのあるパターンを考えてみる。調達部門がサプライヤーのリスク要約を作らせるモデルを導入し、2日かかっていたアナリスト業務を20分に縮める。この削減は本物で、きれいに測定できる。ところが締結済みサプライヤー契約のスループットはまったく動かない。実際の制約は、6週間で回っている法務レビューの待ち行列だったからだ。
この組織は、手をつけなかった工程を待っていた工程のほうを自動化した。効果は本物だったが、待ち行列がそれをすべて吸収した。
あらゆる取締役会にとっての実務的な帰結はこうだ。モデルに何ができるかを問うのをやめること。いま仕事がどこで、どれだけ待たされているかを問うこと。モデルが最長の待ち行列に触れないなら、その事業計画は会計上の作文にすぎない。待ち時間はパイロットを承認する前に測ること。落胆したあとではない。
全員が同じ神託に伺いを立てると、誤差は打ち消し合わなくなる
集団が平均的な構成員を上回るのは、構成員の誤差が独立している場合に限られる。誤差が相関すれば、合意は自信をもって、集団として間違う。同意という安心感だけがあり、その中身はない。
企業のAIは、設計上、誤差を相関させる。本格的な導入のほとんどは、ひと握りのフロンティアモデルの上に載っている。一社の中では、検索は単一の文書コーパスを、単一のプロンプトテンプレートを通り、単一のプラットフォームチームが保守している。そのスタックに問い合わせる5人のアナリストは、5人のアナリストではない。1人のアナリストを5回サンプリングしているだけだ。
対策は地味で、安上がりだ。生きた対照群を維持すること。影響の大きい意思決定の5〜10%を、支援なしの人間の判断に恒久的に回す。一度きりの監査としてではない。支援あり群と支援なし群が乖離したとき、モデル側の欠陥か人間側の欠陥のどちらかを見つけたことになる。どちらも知る価値があり、乖離が起きる場所は誰の予想とも大抵ずれている。
署名のない判断は統制ではない
モデルの出力は身元不明のまま届く。モデルが書いた段落と、論を立てて書かれた段落は、仕上がった文書の中では見分けがつかない。どの文なら質問に耐えて誰かが弁護するのか、どの文が流し読みを生き延びただけなのか、レビュアーには判別できない。帰属のない段落が一つ増えるごとに説明責任は薄れ、やがてその数字を実際に信じた人間が誰なのか、経路の誰にも言えなくなる。
三つの項目でほとんどが解決する。意思決定者に届くモデル由来の判断すべてに、これが正しいことに責任を負うのは誰か、どの文脈がそれを生んだか、そして何があれば考えを変えるかを一行で添える。そのうえで、判断は都度生成し直すのではなく保存する。保存された判断には著者と日付がある。生成し直された判断は問うたびに違い、誰にも責任を負わず、閲覧のたびに課金される。
これは、そもそもエージェントを監査可能にする規律と同じものだ。その論拠はAIエージェントはなぜ不正をするのか、そして実際に機能するガバナンスにある。
ドバイで導入前の段階が実際に払わせている代償
GCCの63%は技術の遅れではない。域内のリーダーはAIが重要になると見ている。同じDeloitte調査で93%が組織への大きな影響を予測している。隔たりがあるのは、号令と最初に動くシステムとのあいだであり、そこがまさに95%という失敗パターンの温床だ。長い評価、広すぎるフレームワーク、待ち行列を動かすのではなく仮説を証明するために設計されたパイロット。
抜け道は、測定された基準値をもつ狭い範囲だ。一つの業務、一人の責任者、前後で時間を計れる一つの待ち行列。一日の終わりまでに実際の仕事を一つ引き受けるシステムは、どんな戦略資料も反論できない事実であり、組織を63%から外に出す唯一の種類の証拠でもある。
仕事が最も長く待たされている業務を選び、そこから始めること。クリニック・デイでは、あなたの業務を一つ取り上げ、その上で動くエージェントを構築し、夕方までに測定された前後の比較を手渡す。95%へのアンチパターンだ。パイロットの墓場がすでに埋まっているなら、五段階のコンサルティング手法は、ユースケースではなく待ち行列を見つけるところから始まる。
Frequently asked questions
Why do 95% of AI pilots fail to show ROI?+
MIT NANDA's 2025 study of over 300 enterprise AI initiatives found the failures were rarely failures of output. The systems generated good summaries, drafts, and classifications. They were pointed at the wrong constraint: automating steps that were already waiting on a slower queue elsewhere, so the gain was absorbed before it reached the P&L.
What should we measure before approving an AI pilot?+
Measure where work waits, and for how long, before approving the pilot, not after it disappoints. If the AI does not touch the longest queue in the process, the business case is an accounting exercise. Wait times, not task times, predict whether throughput will move.
How many GCC organisations are still pre-implementation on AI?+
Deloitte's 2025 survey of senior tax and finance leaders across Saudi Arabia, the UAE, Qatar, and Kuwait found more than 63% of GCC organisations remain in pre-implementation stages. Only 9% have begun scaling solutions.

