一个KYC评分、一个欺诈标记、一次简历淘汰:每一条都是针对具名个人或公司、带时间戳且长期留存的判断。产生它的推理几个月内就蒸发了。记录却会留存多年,总有一天,有权发问的人会问:这是谁签的字。
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
一家中型银行的交易监控系统,在午饭前就会生成几千条有争议的判断。每一次KYC负面舆情匹配、每一个欺诈倾向标记、每一个供应商风险评分、每一次简历淘汰,都是针对具名个人或公司、带时间戳且长期留存的裁定。在52%的DIFC企业已在使用AI的情况下,这条生产线已经在整个金融区运转。
有一种不对称,比模型准确率更值得合规负责人警惕:模型的推理是易逝的,它的输出是永久的。三年后,在一场纠纷或一次监管审查中,那个评分就是证据。而所有能让它站得住脚的东西,都已经不在了。
留下来的是结果,不是产生结果的论证
一个在2024年把某家供应商判为高风险的分类器,留下的只有那个评分。它没有留下模型版本、提示词、阈值、训练数据分布,也没有留下制定该政策的分析师。产生这条记录的判断,几个月内就蒸发了。记录本身留存多年,在带着敌意的读者眼里,它读起来就像贵公司下达的一纸判决。
多数企业的内容系统和风险系统都会保存结果、丢弃推理。这原本是一个存储层面的决定,通常由配置这条流水线的人顺手做出。而如今,它就是一份站得住脚的记录与一份站不住脚的记录之间的分界线。
终结GARM的是取证成本,不是一纸裁决
最清楚的案例来自商业领域,而且就在不久前。GARM是广告行业的品牌安全机构,负责制定广告主愿意规避的内容类别的共用分类体系。完全自愿,完全商业。X Corp在2024年8月提起诉讼,GARM在几天之内就停止了运作。它的上级联合会明确表示,自己没有资源应对这场诉讼。
从来没有哪家法院判定过这套分类体系有错。终结这个组织的,是证据开示程序的成本。
请仔细读这一段,因为这才是真正的风险模型。你不需要败诉。你只需要负担不起把过程重建出来的代价。如果你的团队无法在被要求时,就一项30个月前作出的决定拿出模型版本、阈值、输入、输出和具名的政策负责人,那么一纸传票就不再是法律问题,而是运营上的不可能。
没有人会在一个概率上签字
多数AI治理项目在可解释性上投入很重:特征归因、注意力图、模型卡。而在权责归属上几乎不投入。这是本末倒置。从来没有哪一次调查,会因为一段关于模型如何得出0.83的解释而收场。调查要的是一个名字。
补救办法很具体,现在就能低成本落地。任何与具名个人或公司挂钩的AI判断,都要在数值旁边一并存下三样东西:授权这项决定的政策版本、对该政策负责的人的岗位、以及当时写下的推理。在作出判断的那一刻存一次,且不可更改。事后重新生成的推理,只是一条披着旧日期的新判断。
这与可审计的智能体和无人担责的智能体之间的区别是同一种存储纪律,只不过用在分类上,而不是用在行动上。
把分类器和它的后果分开
对跨法域经营的公司来说,同一个分类器,在一个监管机构眼里是义务,在另一个监管机构眼里是风险敞口。欧盟《数字服务法》要求大型平台建设风险缓释类分类器,罚则最高可达全球营业额的6%。另一些法域则认为,激进的过滤本身就是风险敞口。一套全球统一的政策不可能同时满足两边。
那些处理得当的公司,不再去找那个中立的设置,而是做了一件更枯燥的事:把分类器和它的后果分开。模型爱怎么打分都可以。评分会触发什么——拦截、转人工复核,还是仅仅加一条备注——则是一份按法域划定的政策产物,有自己的负责人、变更记录和法务审查。
这种拆分也回答了听证会上真正会被问到的那个问题。不是「你们的AI为什么会那样认为」,而是「接下来发生什么,是谁决定的,依据谁的授权」。
阿联酋企业的决策框架
如果你的AI系统会产生按对象留存的判断(评分、标记、分类、淘汰),而你无法把24个月前某个案子的完整决策来源重建出来,那就先停止扩大覆盖面,把留存问题解决掉。风险敞口随着量而累积。每多扩张一个月,就多买进一份。
如果你的判断是易逝的或聚合性的,比如预测、产能规划,或者不留下按人留存记录的路由分发,那就跳过那套沉重的溯源装置,把钱花在分类器与后果的分离上。而在采购任何新的分类系统时,要问供应商的问题不是准确率。而是:当有权发问的人问起这一项具体决定是谁授权的,你的系统会返回什么?
溯源是一个架构决定,而且在量起来之前做最便宜。五步咨询方法会梳理清楚:你的AI判断中哪些会长期留存、每一条要存下什么才站得住脚、背后的政策归谁所有——在监管机构或索赔方先开口之前。若要在单一流程上做一次受治理的首次落地,诊断日会从一开始就把记录留存建进去。
Frequently asked questions
What should be stored alongside every AI-derived decision?+
Three things, written once at decision time: the policy version that authorised the decision, the human role accountable for that policy, and the reasoning as it stood at the moment of the call. Reasoning regenerated later is a new judgement wearing an old date, and it will not survive questioning.
Why did GARM shut down, and what does it teach AI governance teams?+
GARM, the advertising industry's brand-safety body, discontinued operations within days of being sued by X in August 2024. Its parent federation said plainly that it lacked the resources to fight the case. No court ruled its taxonomy wrong; the cost of the discovery process ended it. The lesson: you do not need to lose a case to be destroyed by one, you only need to be unable to afford the reconstruction of your own decisions.
Can regenerated AI explanations be used as audit evidence?+
No. A regenerated explanation is produced by a different model state, under a different prompt, at a different time from the decision it claims to explain. Auditors and courts want the contemporaneous record: what was known, decided, and authorised at the moment of the call.

