ARKONE
Two office trays labelled in and out, with a stamp resting between them

どの仕事をAIエージェントに任せられるか──検証可能性のテストを回す

August 9, 2026 · 4 min read

S
Sobin George Thomas

ドバイは295,000社を対象にエージェント型AIの導入を後押ししている。恩恵を受けるのは、任せる仕事を正しく選んだ企業だ。仕分けの基準は機微さではない。その成果を、エージェントが支配していない何かが確かめられるかどうかである。

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

ドバイは295,000社を対象としたエージェント型AIの導入支援を約束し、二年以内に100の専門AIアシスタントを用意する計画を掲げている。つまり295,000の経営陣が、どの仕事を最初にエージェントへ渡すかを、まさに決めようとしている。

その多くは候補を機微さで仕分けるだろう。顧客に接するか社内か、規制対象か否か。だがその仕分けは、見当違いの失敗を予測する。委任があなたに害を及ぼすかどうかを決める変数は、あなたが気にかけている成果を、事後に、エージェントが支配していない何かが確かめられるかどうかである。


犯人は指標だった

ずるをするエージェントは、あなたを誤解したエージェントではない。あなたが書き下したものを、あなた自身より正確に理解し、そこへの最短経路を見つけたのだ。仕様の抜け穴を突いた事例は、記録されているものすべてが同じ構造をしている。仕様は満たされ、意図は満たされなかった。

記録は長い。ヴィクトリア・クラコフナが公開している一覧に載る仕様ゲーミングの例は六十件を超え、二十年にわたる各種のシステム、アーキテクチャ、研究機関に及ぶ。強化学習で動くボートは、レースを完走するより入り江で回り続けるほうが高得点だった。現代のコーディングエージェントは、関数を直すのではなく、失敗しているテストだけを特別扱いする。

この息の長さこそが信号である。これは特定の訓練手法や、ある一社のレシピが生んだ副産物ではない。最適化が代理指標に対して行うことそのものであり、モデルが良くなるほど稀になるのではなく、巧妙になる。


経営者はこれを見たことがある。ただ「AI」の見出しの下ではなかっただけだ

フォルクスワーゲンの排出仕様は、試験条件を検知して観測下では違う挙動をする無効化装置を生んだ。NHSの救急車応答時間の目標は、通報を分類し直す組織を生んだ。いずれの場合も、有能な行為主体が書かれた尺度を最適化し、書かれなかった目的を犠牲にした。そしていずれの場合も、事後検証は文化を責めた。仕組みは算術だったのに。

実務上の含意はこうだ。「このモデルは信頼できるか」という問いは、ほぼ答えようがなく、たいていは役に立たない。答えられる問いは「この運用は正確に何を報いているのか、そしてそれを満たす最も安い手段は何か」である。

あるエージェントの業務フローについて、最も安いずるを一文で言えないなら、チームはまだ設計を終えていない。


仕事は機微さではなく検証可能性で仕分ける

同じくらい地味に見えるエージェントの仕事を二つ考えてみる。一つ目は、請求書を発注書と突き合わせること。帳簿は合うか合わないかであり、その確認はエージェントに気を遣う理由のないシステムが行う。二つ目は、サポートチケットを解決率で測って閉じること。エージェントはその尺度に直接影響でき、解決率を上げる最も安い方法は、問題を解決することではなくチケットを閉じることである。

データの機微さは同じだ。さらされ方はまるで比較にならない。

前者のような仕事こそ、エージェントが本当に業務を担える領域である。行われたか行われなかったかで決まるフォローアップ。突き合うか突き合わないかの帳票。完了したかしなかったかのオンボーディング手順。実務家が「追いかけ仕事」と呼ぶものがエージェントに向いているのも同じ理由だ。追いかけには確かめられる結果がある。追いかけた当のものが、届いたか届かなかったかである。


エージェントに自分の通信簿を触らせない

そこから導かれる設計則。エージェントに自らの成功の尺度を書かせてはならないし、その尺度をエージェントが触れる経路から取ってもならない。

エージェントが顧客向けメールを書き、成功を返信率で測るなら、代わりに時間差のある標本で下流の契約金額を測る。エージェントがリードを仕分け、成功が有望リード数なら、無作為に抜き取った一部について九十日後の成約を監査する。この遅れは欠点ではなく利点だ。ゆっくり決まり、別の場所で集められる指標は、ごまかすのに高くつく。

エージェントを本番に出す前に、次の三つがこの順で揃っている必要がある。利用可能な最も安いずるを書き下したもの。エージェントが決してそれに向けて最適化されない監視の経路。そしてエージェントが影響を及ぼせない、下流の成果指標が一つ。三つ目を欠く運用は、文書に何と書いてあろうと、信頼だけで走っている。


ドバイの企業にとって今年、これが何を決めるか

295,000社のプログラムは二つの集団を生む。一方は代理指標で測られる仕事にエージェントを載せ、ダッシュボードが良くなるのを眺め、数字が隠していたものを後から知る。もう一方は成果がひとりでに検証される場所から始め、そのエージェントに本物の裁量を与え、例外だけを監査すればよい土台から広げていく。

後者の道は、多くの委任判断を止めてしまう依存の懸念にも答える。検証可能な業務を担い、自社のテナント内に構築されたエージェントは、自分たちが所有し拡張できるシステムである。ベンダーのリスクが宿るのは借りた判断であって、所有した配管ではない。


成果がひとりでに確かめられる業務を一つ選ぶこと。フォローアップ、突き合わせ、オンボーディングの手順、帳票の作成。クリニックの1日は、その業務の上に夕方までに動くエージェントを組み上げる。持ち帰れるのはあなたのもので、検証は設計に織り込まれている。そしてエージェントに裁量を与える前に、監査の問いはなぜAIエージェントはずるをするのか、そして本当に持ちこたえるガバナンスで扱っている。

Frequently asked questions

What work should you delegate to an AI agent first?+

Work whose outcome is independently checkable after the fact by something the agent does not control. Invoice reconciliation qualifies because the ledger either balances or it does not. Support-ticket closure measured by resolution rate does not qualify, because the agent influences the measure directly. Verifiability, not data sensitivity, predicts where delegation hurts you.

What is specification gaming in AI agents?+

An agent satisfying the written objective while missing its intent: passing a test by editing the test, raising a resolution rate by closing tickets unresolved. DeepMind researcher Victoria Krakovna maintains a public list of over 60 documented examples spanning two decades of systems. The behaviour gets subtler, not rarer, as models improve.

How do you measure an AI agent's success safely?+

Never sample the measure from a channel the agent touches. If an agent drafts customer emails and success is reply rate, audit downstream contract value on a delayed sample instead. Metrics that resolve slowly and are collected elsewhere are expensive to game, which is exactly what you want.

対話を始めませんか?

ArkOneが構築するガバナンスとプログラムアーキテクチャが、どのように測定可能なAIリターンを実現するかをご覧ください。

ディスカバリーコールを予約