为某一目的建立的数据库终将被挪作他用。这是观察到的默认结果,而非预测。数据最小化一直被当作合规成本推销给管理层;更准确地说,它是在为每一个数据可能变成负债的未来购买选择权。
This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.
美国联邦调查局的CODIS数据库始于1990年,最初是一件用于比对暴力犯罪现场DNA证据的工具。如今它收录了超过2000万份档案,其纳入标准一次又一次地放宽,一部法规接着一部法规,一类逮捕情形接着一类逮捕情形。没有人对这个累积的结果投过票。每一次放宽,单独来看都站得住脚。
这条轨迹并不是丑闻,而是每一个存活得比其设立初衷更久的数据库所呈现的默认结果。对一家企业而言,问题不在于它是否会有一天挪用自己的数据,而在于它今年正在建造的系统,是否会在将来某一天向某个人发出与CODIS向其历任保管者发出的同样的邀约。
挪作他用才是默认,而你的系统已经在发出邀约
把镜头转向内部。你的客户数据平台是为个性化而建的。你的员工监测遥测数据是为安全合规而建的。你的通话录音是为质量管理而建的。上述每一份数据集都有第二种用途,而这种用途对某些人是有吸引力的:监管机构、收购方、诉讼对手,或者处在另一种压力之下的、未来版本的你自己的管理层。
这份邀约不需要在今天被接受。它只需要一直有效。一份没有删除时间表的数据集,就是一份长期有效的期权,由下一个掌控它的人在尚不存在的规则之下随时行使。
一次会议就能做完的测试
挑出你最大的客户数据集,然后问:如果法院明天下令提交它,你的法律义务是什么。多数企业会发现,答案完全取决于留存策略,而这份留存策略是由当初配置存储桶的那个人写下的。
各地监管框架在原则上是一致的。阿联酋个人数据保护法与GDPR的存储期限限制都要求个人数据的保存时间不得超过其目的所需。然而执法的实际形态是:监管机构总是在挪用发生之后才知情,而不是之前。真正对你产生约束的控制,是你写进自己架构里的那一条。
最小化是一次选择权的购买
数据最小化一直被当作合规成本推销给管理层,一笔缴给隐私团队的税。若如实定价,它恰恰相反:它是一次选择权的购买。从未收集的数据不会被传唤,不会被泄露,也不会被一个并不认同你顾虑的继任者挪作他用。
省下的不是存储费用,那几乎是免费的。省下的是这份数据变成负债的那一部分未来。用被存储的AI判断一文的说法,每一条关于具名个人的持久记录,都是一件未来的呈堂证物。而最容易辩护的证物,是从未被创建出来的那一件。
AI时代的张力:保留序列,最小化身份
细心的读者会在这里察觉到一处表面上的矛盾。关于业务论证的那篇文章主张追加而非覆盖,因为模型需要那些事后无法重建的序列。本文主张少收集、早删除。两者都对,只是针对的是不同类别的数据。
业务流程历史 ——状态流转、价格调整、排队时长、决策结果——应当积极保留。它的价值会累积,而法律风险很低。
持久的个人标识 ——生物特征、关于个人的自由文本、行为画像——应当同样积极地最小化。它们的法律风险会累积,而建模价值通常不会。
失败的模式,是让某一个存储桶的默认设置同时回答这两个问题。留存应当是分类别做出的决定,写下来,指定负责人,就像任何一份终有一天会在听证会上被朗读出来的政策一样。
在智能体大规模到来之前该做什么
对于一家正走向智能体的阿联酋企业来说,顺序很重要。智能体会同时放大数据的产生与消耗:它们记录决策(好事),读取历史(好事),也可能在无人清点的中间存储中悄悄累积个人数据(CODIS的模式,以创业公司的速度重演)。
先分类,再扩张。花一个下午把你的数据存储标注为「序列上有价值」「身份上敏感」「两者皆是」或「两者皆非」,这将塑造你的智能体所继承的每一项留存默认值。跳过这一步的企业同样做出了决定,只是在沉默中做出的,方向由那个默认存储桶决定。
留存设计如果发生在建造之前,是一场半天的对话;如果发生在建造之后,就是诉讼支持。五步咨询方法把数据类别地图列为常设工作:留什么、删什么、每个答案由谁负责——在你的第一个智能体继承那些默认值之前。
Frequently asked questions
Why is data minimisation more than a compliance cost?+
Because data you never collected cannot be subpoenaed, breached, or repurposed by a successor with different priorities. The savings are not in storage. They are in the range of futures where the dataset becomes a liability: litigation discovery, an acquirer's due diligence, a regulator's production order, or an internal use nobody would have approved at collection time.
How should AI-era retention policy differ by data class?+
Retain business-process history aggressively, because models that predict stalling deals or churn need sequences that cannot be reconstructed later. Minimise durable personal identifiers just as aggressively, because they compound legal exposure with volume. The failure mode is letting one bucket default answer both questions.
What is the quickest test of your data exposure?+
Pick your largest customer dataset and ask what your legal obligation would be if a court ordered its production tomorrow. Most firms discover the answer depends entirely on retention policy, and that their retention policy was written by whoever configured the storage bucket.

