ARKONE
Two mail slots side by side in an office door, one marked with a lock

管好你的 AI 智能体发出去的东西:要两道过滤,不是一道

August 9, 2026 · 5 min read

S
Sobin George Thomas

生产文本和代码几乎已是免费,判断它们却没有变便宜。把完整性管控和表达性判断混为一体的企业,为了保护后者而拖慢前者,而这恰好发生在自家智能体发出的东西开始超过员工的时候。

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

生产材料,无论是文本还是代码,几乎已经是免费的。判断它们却没有变便宜。这一个不对称,如今横在两个看似毫无关联的问题底下:每次执行都会重写自己的恶意软件,以及大量由智能体起草、没人读过就离开你自家系统的邮件、工单和代码提交。

2025年,ESET 研究人员识别出 PromptLock,第一个已知的由 AI 驱动的勒索软件:它在运行时调用语言模型,即时生成自己的恶意脚本。后来查明这是一个学术性的概念验证,从未在真实攻击中被观测到。把这当作可以放心的理由,才是错误。真正相关的事实是新变种的边际成本,它已经跌到大约一次推理调用的价格。


攻击者的代码不再是一件耐用品

杀毒行业的经济学建立在一个无声的假设上:写出真正新颖的恶意软件很贵,所以攻击者复用代码,所以同族样本共享特征码,所以一次分析可以保护数百万个终端。检测比攻击更容易规模化。整场博弈就靠这个。

运行时生成的恶意软件打断了这种复用。当一个样本每次运行都重新生成自己的加载器,就没有可以提取特征码的族。最初的样本很笨拙;重要的是走向。

对防守方的含义与当前大多数安全预算相抵触。如果特征码在失效,钱就要转向行为:一个进程对文件系统、网络、凭据库究竟做了什么。行为检测一直是更贵、更容易误报的选项,所以它一直只是补充手段。现在它是第一道防线,而在多数企业里,预算还没有挪动。


先到的量的问题,来自你自己的智能体

生成成本的同样崩塌,也适用于你自家系统产出的材料。一家运行着智能体去起草客户邮件、提交支持工单、提交代码的企业,等于把没人在发出前读过的产物工业化生产了。当年让社交平台无法做到全量人工审核的那个量的论据,如今正抵达一家 400 人企业的内部。

这不是放慢智能体的理由。这是要你清楚知道:哪些检查会自动作用于所有东西,哪些决定仍然需要一个有名有姓的人。分不清这条界线的企业,最后会让同一个委员会审两件事,结果是两件都审不好。


两种能力为了图省事被合成了一种

战略上的错误,是把”过滤”当作一种能力。它是两种,风险特征恰好相反。

完整性管控判断一个产物是否真实、执行是否安全、来源是否如其所称:拦下一个自我修改的二进制文件,拒收一张伪造发票,隔离智能体发出的外部 API 调用。这是工程。它几乎不带来政治或法律上的暴露,而支持扩大它的理由刚刚变得强了很多。

表达性判断决定一条被允许的、真实的消息是否应当被送出:你的企业愿意说什么、对谁说、在哪个法域说。有争议的暴露就住在这里。

一家零售银行把这条分界线摆得很清楚。它对客户经理可以在客户邮件里写哪些措辞的规定,属于表达性判断:可被争辩、因法域而异、越少越好。它对 AI 助手能否执行一条自己起草的付款指令的规定,属于完整性管控:技术性的、绝对的、越多越好。多数机构把两者都送进同一个治理委员会,于是后者被前者的敏感性拖慢。


在组织架构、审计留痕和预算里把它们分开

运作规则是:完整性管控应当能在一天内上线一条新规则。表达性判断则不应当在没有书面记录说明谁做的决定、依据是什么的情况下上线任何一条。

第二条要求,正是让你所存储的每一次 AI 判断都站得住脚的那套来源规范:一个政策版本、一个负责的角色、当时写下的理由。完整性规则不需要任何这类仪式,而这正是它们不该排在这套仪式后面的原因。


对一家阿联酋企业来说,第一处暴露实际在哪里

最先够到多数企业的威胁,不是新型勒索软件。是它们自己的自动化按一条被投毒的指令行事:一个拥有付款权限的智能体读到一封伪造邮件,一条对外集成被指向攻击者的端点。DFSA 发现 21% 在关键流程中使用 AI 的 DIFC 企业缺乏监督,说的正是这个缺口:能力先于本该包住它的完整性层被部署了。

如果你的安全投入仍然偏向特征码检测,本预算周期就把增量挪到行为控制和身份控制上,并且明确对准你自家智能体的对外行为。限定范围的权限、支出上限、目的地白名单,加上一份不可篡改的日志,覆盖了大部分面,而且没有一项会拖慢智能体。


一个从设计之初就带着完整性层的智能体,不是上线更慢,而是获批更快。一场诊断日会在你的某一个流程上,用限定范围的对外权限、有记录的动作、以及在不可逆步骤上的人工签批,在傍晚前造出一个能跑的智能体。这些控制背后的治理思路,写在为什么 AI 智能体会作弊,以及真正撑得住的治理里。

Frequently asked questions

What is the difference between integrity control and expressive judgement?+

Integrity control decides whether an artefact is authentic, safe to execute, and originated where it claims: blocking a self-modifying binary, rejecting a spoofed invoice, quarantining an agent's outbound API call. Expressive judgement decides whether a permitted, authentic message should be carried. The first is engineering with little exposure; the second carries legal and reputational exposure in every jurisdiction. Fusing them slows the safe one to protect the contested one.

Why is signature-based malware detection losing ground to behavioural detection?+

Signature economics assumed writing novel malware was expensive, so attackers reused code and one analysis defended millions of endpoints. ESET's PromptLock proof-of-concept showed malware can now call a language model at runtime and regenerate its own scripts on each execution, leaving no stable family to signature. When variants cost an API call, the durable signal is behaviour: what a process does to files, networks, and credentials.

Do AI agent outputs need review before they are sent?+

Volume makes universal human review impossible, which is the point of splitting the filters. Integrity checks (authenticity, permissions, spend limits, destination allow-lists) run automatically on everything. Human judgement is reserved for the expressive layer and for actions that are expensive to reverse.

准备好开始对话了吗?

了解 ArkOne 如何构建治理体系与项目架构,实现可量化的 AI 回报。

预约探索性沟通