MIT的NANDA研究发现,95%的生成式人工智能试点没有产生可衡量的业务回报。在海湾合作委员会地区,63%的组织仍处于实施前阶段。约束从来不是模型,而是工作在哪里排队等待。
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
两个数字从不同侧面描述了同一道鸿沟。MIT NANDA的State of AI in Business研究审阅了300多个企业人工智能项目,发现其中约95%对损益表没有产生任何可衡量的影响。而Deloitte针对海湾合作委员会地区的调查显示,在受访的财务与税务高管中,该地区超过63%的组织仍停留在实施前阶段,只有9%真正把某件事推向规模化。
听起来舒服的解释是技术还不成熟。证据并不支持这一点。把失败案例逐个读下来,几乎没有一个是输出层面的失败。系统生成了摘要、草稿和分类,而且生成得不错。它们只是被指向了错误的约束。
试点并没有败在输出上
NANDA的研究人员访谈了52家组织,并对153位高管做了问卷调查。95%背后的规律不是模型有缺陷,而是这些系统从未触及发起人真正在意的那个数字。采用率高,转型度低:九个行业中有七个呈现出报告所说的「广泛试验而无结构性变化」。
这个区分之所以重要,是因为它决定了谁该负责修正。能力问题属于供应商,会在未来某个模型版本中解决。部署问题属于选择自动化对象的人。在95%的案例里,正是这个选择决定了结果。模型从头到尾都没有投票权。
自动化了本来就在排队等待的那一步
看一个在十几家公司都能认出来的模式。采购部门部署了一个模型来生成供应商风险摘要,把分析师两天的工作压缩到二十分钟。这个节省是真实的,也能干净地衡量。但已签署供应商合同的通过量完全没有变化,因为真正的约束是一条运行周期长达六周的法务审查队列。
这家组织自动化的,恰恰是那个正在等待它没有触碰的环节的步骤。收益是真的,队列把它全部吸收掉了。
对任何董事会来说,实际的推论是:别再问模型能做哪些任务。要问的是,工作现在在哪里等待,等多久。如果模型没有触及最长的那条队列,商业论证就只是一次会计练习。在批准试点之前测量等待时间,而不是在它令人失望之后。
当所有人都请教同一个神谕,误差就不再互相抵消
只有当成员的误差彼此独立时,群体的表现才会超过其平均成员。一旦误差相关,共识就会变成自信而集体的错误:有认同带来的全部安心感,却没有任何实质。
企业人工智能在设计上就让误差相关。绝大多数严肃的部署都建立在少数几个前沿模型之上。在同一家公司内部,检索跑在同一个文档语料库上,穿过同一套提示词模板,由同一个平台团队维护。五名分析师去问这套系统,他们不是五名分析师,而是同一名分析师被采样了五次。
对策不起眼,也很便宜:保留一条活的对照臂。把5%到10%的重要决策长期交给无辅助的人类判断,作为常设机制,而不是一次性审计。当有辅助与无辅助两组人群出现分歧时,你要么发现了模型的问题,要么发现了人的问题。两者都值得知道,而分歧出现的位置,很少是任何人预想的地方。
没有署名的判断不是控制措施
模型输出到达时是无主的。在最终的备忘录里,模型起草的段落和经过论证的段落看上去一模一样。审阅者分不清哪些句子有人愿意在被追问时辩护,哪些只是侥幸躲过了一次快速浏览。问责就这样一段一段地流失,直到链条上没有人说得出,究竟是谁真正相信那个数字。
三个字段可以解决大部分问题,适用于每一个抵达决策者的模型衍生判断:谁为它的正确性负责,是什么上下文产生了它,以及用一行字说明什么会让这个人改变看法。然后把判断存下来,而不是每次按需重新生成。存下来的判断有作者,也有日期。重新生成的判断每次问都不一样,不对任何人负责,而且每看一次就再向你收一次费。
这与让智能体在一开始就可被审计的纪律是同一件事。相关论证见人工智能智能体为什么会作弊,以及真正管得住的治理。
在迪拜,停留在实施前阶段的真实代价
海湾合作委员会地区的63%不是技术上的落后。该地区的领导者预期人工智能会带来影响:在同一份Deloitte调查中,93%预测会出现显著的组织层面影响。差距落在授权与第一个真正可用的系统之间,而那里恰恰是95%失败模式的温床:漫长的评估、宽泛的框架、为证明某个论点而不是为推动某条队列而设定范围的试点。
出路是窄范围加上已测量的基线。一个流程,一位责任人,一条你能在前后都计时的队列。一个在一天结束前就真正接管了一块实际工作的系统,是任何战略汇报都无法反驳的事实依据,也是唯一能把一家组织带出那63%的证据。
挑出工作等待时间最长的那个流程,从那里开始。诊断日会选取你的一个流程,在上面构建一个能运行的智能体,并在当天傍晚交给你测量出来的前后对比,这正是95%的反面。如果试点的坟场已经塞满了,五步咨询方法的第一步是找到队列,而不是找用例。
Frequently asked questions
Why do 95% of AI pilots fail to show ROI?+
MIT NANDA's 2025 study of over 300 enterprise AI initiatives found the failures were rarely failures of output. The systems generated good summaries, drafts, and classifications. They were pointed at the wrong constraint: automating steps that were already waiting on a slower queue elsewhere, so the gain was absorbed before it reached the P&L.
What should we measure before approving an AI pilot?+
Measure where work waits, and for how long, before approving the pilot, not after it disappoints. If the AI does not touch the longest queue in the process, the business case is an accounting exercise. Wait times, not task times, predict whether throughput will move.
How many GCC organisations are still pre-implementation on AI?+
Deloitte's 2025 survey of senior tax and finance leaders across Saudi Arabia, the UAE, Qatar, and Kuwait found more than 63% of GCC organisations remain in pre-implementation stages. Only 9% have begun scaling solutions.

