ARKONE
Two mail slots side by side in an office door, one marked with a lock

AIエージェントが送るものを統治する:フィルターは一つではなく二つ

August 9, 2026 · 5 min read

S
Sobin George Thomas

テキストやコードを生み出すコストはほぼゼロになったが、それを判断するコストは下がっていない。健全性の管理と表現上の判断を一体で運用する企業は、後者を守るために前者を遅らせている。自社のエージェントが社員よりも多くを送り始めた、まさにその時期に。

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

テキストであれコードであれ、素材を生み出すコストはほぼゼロになった。それを判断するコストは下がっていない。この一つの非対称性が、いま無関係に見える二つの問題の下に横たわっている。実行のたびに自らを書き換えるマルウェアと、誰にも読まれないまま自社システムから出ていく、エージェントが下書きしたメール・チケット・コミットの洪水である。

2025年、ESETの研究者はPromptLockを特定した。AIを利用した初の既知のランサムウェアで、実行時に言語モデルを呼び出し、悪意あるスクリプトをその場で生成する。結果的にこれは学術的な概念実証であり、実際の攻撃で観測されたことは一度もない。それを安心材料と受け取るのが誤りである。重要な事実は、新しい亜種の限界費用が推論呼び出し一回分の価格程度まで下がったという点だ。


攻撃者のコードは、もはや長持ちする物ではなくなった

アンチウイルスの経済学は、静かな前提の上に成り立っていた。本当に新規のマルウェアを書くのは高くつく、だから攻撃者はコードを再利用する、だから検体のファミリーはシグネチャを共有する、だから一件の解析が数百万台のエンドポイントを守る。攻撃よりも検知のほうがうまくスケールした。それがゲームのすべてだった。

実行時に生成されるマルウェアは、この再利用を壊す。検体が実行のたびに自分のローダーを再生成するなら、シグネチャを取るべきファミリーが存在しない。初期の検体は稚拙だが、問題は軌道のほうだ。

防御側への含意は、現在のセキュリティ予算の大半と衝突する。シグネチャが劣化するなら、金は振る舞いへ移る。プロセスがファイルシステム、ネットワーク、資格情報ストアに対して実際に何をするか、である。振る舞い検知は昔から高価で誤検知も出やすい選択肢であり、だからこそ補助にとどまっていた。それがいまや主戦線になったのに、多くの企業では予算がまだ動いていない。


先に届く量の問題は、自社のエージェントである

生成コストの同じ崩壊は、自社システムが生み出す素材にも当てはまる。顧客向けメールを下書きし、サポートチケットを起票し、コードをコミットするエージェントを走らせている企業は、発信前に誰も読まない成果物の生産を工業化したことになる。ソーシャルプラットフォームで人手による全件レビューを不可能にしたあの量の議論が、いま従業員400人の企業の内部に到達している。

これはエージェントを減速させる理由ではない。何に対して自動で必ず走る検査はどれか、そして依然として名前のある人間の判断を要する決定はどれかを、正確に把握する理由である。この区別ができない企業は、結局ひとつの委員会が両方を審査することになり、つまりどちらもまともに審査されない。


二つの能力が、便宜のために融合された

戦略上の誤りは、「フィルタリング」を一つの能力として扱うことだ。これは二つあり、リスクの性質は正反対である。

健全性の管理は、成果物が本物か、実行して安全か、名乗るとおりの出所かを決める。自己書き換えするバイナリを遮断する、なりすまし請求書を拒否する、エージェントの外向きAPI呼び出しを隔離する。これは工学である。政治的・法的な露出はほぼなく、これを拡大すべき根拠は今まさに大きく強まった。

表現上の判断は、許可された本物のメッセージを実際に送ってよいかを決める。自社が何を、誰に、どの法域で言う用意があるか、である。争いの火種となる露出はここにある。

リテール銀行を見ると、この分割がきれいに見える。担当者が顧客宛メールにどの言葉を書いてよいかという方針は表現上の判断であり、異議を唱えられうるし、法域ごとに異なり、小さくしておくのが得だ。AIアシスタントが自ら下書きした支払指図を実行してよいかという方針は健全性の管理であり、技術的で、絶対的で、広げるのが得だ。大半の金融機関は両方を同じガバナンス委員会に通すので、後者が前者の機微さに引きずられて遅くなる。


組織図でも、監査証跡でも、予算でも切り離す

運用上の原則はこうだ。健全性の管理は、新しいルールを一日で出せるべきである。表現上の判断は、誰がどんな根拠で決めたかの書面記録なしにルールを出せてはならない。

この二つ目の要件は、保存されたAIの判断を弁明可能にするのと同じ来歴の規律である。方針のバージョン、責任を負う役割、その時点で書かれた理由。健全性のルールにはこうした儀式は一切不要であり、だからこそその列の後ろに並ばせてはならない。


UAEの企業にとって、最初の露出が実際にあるのはどこか

多くの企業に最初に届く脅威は、目新しいランサムウェアではない。汚染された指示に従って動く自社の自動化である。支払権限を持つエージェントがなりすましメールを読む、外向きの連携が攻撃者のエンドポイントに向いている。DFSAが示した、重要業務でAIを使うDIFC企業の21%に監督が欠けているという結果は、まさにこの隙間を描いている。能力が、それを囲うべき健全性の層より先に配備されているのだ。

セキュリティ支出がいまだシグネチャ検知に偏っているなら、今期の予算増分を振る舞いと本人確認の制御へ移し、その照準を自社エージェントの外向きの振る舞いに合わせること。権限の限定、支出上限、送信先の許可リスト、改ざんできないログ。これで面の大半は覆えるし、どれ一つエージェントを遅くしない。


健全性の層を設計に織り込んで作られたエージェントは、出荷が遅いのではない。承認が速いのだ。クリニックの一日では、御社の業務の一つを対象に、外向きを限定し、行動を記録し、不可逆な手順には人間の承認を挟んだ、実際に動くエージェントを夕方までに作る。これらの制御の背後にあるガバナンスの考え方は、なぜAIエージェントは不正をするのか、そして実際に持ちこたえるガバナンスにある。

Frequently asked questions

What is the difference between integrity control and expressive judgement?+

Integrity control decides whether an artefact is authentic, safe to execute, and originated where it claims: blocking a self-modifying binary, rejecting a spoofed invoice, quarantining an agent's outbound API call. Expressive judgement decides whether a permitted, authentic message should be carried. The first is engineering with little exposure; the second carries legal and reputational exposure in every jurisdiction. Fusing them slows the safe one to protect the contested one.

Why is signature-based malware detection losing ground to behavioural detection?+

Signature economics assumed writing novel malware was expensive, so attackers reused code and one analysis defended millions of endpoints. ESET's PromptLock proof-of-concept showed malware can now call a language model at runtime and regenerate its own scripts on each execution, leaving no stable family to signature. When variants cost an API call, the durable signal is behaviour: what a process does to files, networks, and credentials.

Do AI agent outputs need review before they are sent?+

Volume makes universal human review impossible, which is the point of splitting the filters. Integrity checks (authenticity, permissions, spend limits, destination allow-lists) run automatically on everything. Human judgement is reserved for the expressive layer and for actions that are expensive to reverse.

対話を始めませんか?

ArkOneが構築するガバナンスとプログラムアーキテクチャが、どのように測定可能なAIリターンを実現するかをご覧ください。

ディスカバリーコールを予約