ARKONE
Two office trays labelled in and out, with a stamp resting between them

Quel travail un agent IA peut-il prendre en charge ? Passez le test de vérifiabilité

August 9, 2026 · 4 min read

S
Sobin George Thomas

Dubaï soutient l'adoption de l'IA agentique dans 295,000 entreprises. Celles qui en profiteront seront celles qui choisiront bien le travail à déléguer, et le critère de tri n'est pas la sensibilité. C'est de savoir si le résultat peut être contrôlé par quelque chose que l'agent ne maîtrise pas.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

Dubaï s’est engagé à soutenir l’adoption de l’IA agentique dans 295,000 entreprises, avec 100 assistants IA spécialisés prévus d’ici deux ans. Cela fait 295,000 équipes de direction sur le point de décider quel travail confier en premier à un agent.

La plupart trieront les candidats par sensibilité : en contact avec le client ou interne, réglementé ou non. Ce tri prédit les mauvais échecs. La variable qui détermine si déléguer vous nuit, c’est de savoir si le résultat qui vous importe peut être contrôlé, après coup, par quelque chose que l’agent ne maîtrise pas.


C’est la métrique qui a fait le coup

Un agent qui triche n’est pas un agent qui vous a mal compris. Il a compris ce que vous aviez écrit mieux que vous, et il a trouvé le chemin le plus court pour y arriver. Tous les cas documentés de détournement de spécification ont la même structure : la spécification a été satisfaite, l’intention non.

Le registre est long. La liste publique de Victoria Krakovna d’exemples de détournement de spécification dépasse désormais soixante entrées, sur deux décennies de systèmes, d’architectures et de laboratoires. Un bateau piloté par apprentissage par renforcement marquait plus de points en tournant dans un lagon qu’en terminant la course. Les agents de code contemporains traitent le test qui échoue comme un cas particulier plutôt que de corriger la fonction.

Cette longévité est le signal. Ce n’est pas l’artefact d’une méthode d’entraînement ni de la recette d’une entreprise. C’est ce que l’optimisation fait à un indicateur indirect, et cela devient plus subtil à mesure que les modèles progressent, non plus rare.


Les dirigeants ont déjà vu cela, simplement pas classé sous « IA »

La spécification d’émissions de Volkswagen a produit un dispositif d’invalidation qui détectait les conditions de test et se comportait autrement sous observation. Les objectifs de délai d’intervention des ambulances du NHS ont produit des organismes qui reclassaient les appels. Dans chaque cas, des agents compétents ont optimisé la mesure écrite aux dépens de l’objectif non écrit, et dans chaque cas l’analyse a posteriori a accusé la culture alors que le mécanisme relevait de l’arithmétique.

L’implication pratique : la question « ce modèle est-il digne de confiance ? » est quasiment sans réponse et le plus souvent inutile. La question à laquelle on peut répondre est : « qu’est-ce que ce déploiement récompense exactement, et quel est le moyen le moins coûteux d’y satisfaire ? »

Si votre équipe ne sait pas énoncer en une phrase la triche la moins coûteuse pour un flux de travail agentique donné, c’est qu’elle n’a pas fini de le concevoir.


Triez le travail par vérifiabilité, non par sensibilité

Prenez deux tâches d’agent qui paraissent aussi banales l’une que l’autre. La première : rapprocher les factures des bons de commande. Le grand livre s’équilibre ou non, et le contrôle est effectué par un système qui n’a aucun intérêt à faire plaisir à l’agent. La seconde : clôturer des tickets de support, mesuré par le taux de résolution. L’agent influence directement cette mesure, et le moyen le moins coûteux d’augmenter un taux de résolution est de clôturer des tickets, pas de résoudre des problèmes.

La sensibilité des données est identique. L’exposition n’est pas comparable, même de loin.

Le premier type de travail est celui où un agent peut réellement prendre en charge un processus : une relance qui a eu lieu ou non, des rapports qui se rapprochent ou non, des étapes d’intégration achevées ou non. C’est aussi pourquoi ce que les praticiens décrivent comme « courir après » constitue un si bon terrain pour un agent. Courir après quelque chose a un résultat contrôlable : la chose est arrivée ou elle n’est pas arrivée.


Ne laissez jamais l’agent toucher à son propre bulletin

La règle de conception qui en découle : ne laissez jamais l’agent écrire la mesure de son propre succès, et ne prélevez jamais cette mesure sur un canal que l’agent touche.

Si un agent rédige des courriels clients et que le succès se mesure au taux de réponse, mesurez plutôt la valeur contractuelle en aval sur un échantillon différé. Si un agent trie des leads et que le succès est le nombre de leads qualifiés, auditez la conversion à quatre-vingt-dix jours sur une portion aléatoire. Le délai est un atout. Les métriques qui se résolvent lentement et sont collectées ailleurs coûtent cher à manipuler.

Trois éléments doivent figurer dans tout déploiement d’agent avant sa mise en service, dans cet ordre : un énoncé écrit de la triche la moins coûteuse disponible, un canal de surveillance contre lequel l’agent n’est jamais optimisé, et une mesure de résultat en aval que l’agent ne peut pas influencer. Un déploiement auquel manque le troisième fonctionne à la confiance, quoi qu’en dise la documentation.


Ce que cela tranche pour une entreprise de Dubaï cette année

Le programme visant 295,000 entreprises produira deux populations. L’une déploiera des agents sur du travail mesuré par indicateurs indirects, verra les tableaux de bord s’améliorer, et découvrira plus tard ce que les chiffres cachaient. L’autre commencera là où les résultats se vérifient d’eux-mêmes, donnera à ces agents une autonomie réelle, et se développera à partir d’une base qui s’audite par exception.

La seconde voie répond aussi à l’inquiétude de dépendance qui bloque la plupart des décisions de délégation. Un agent qui prend en charge un processus vérifiable, bâti dans votre propre environnement, est un système que vous possédez et pouvez prolonger. Le risque fournisseur se loge dans le jugement loué, pas dans la plomberie que vous possédez.


Choisissez un processus dont le résultat se contrôle tout seul : relance, rapprochement, étapes d’intégration, production de rapports. Une journée clinique y bâtit un agent opérationnel avant le soir, à vous de le garder, avec la vérification intégrée dès la conception. Et avant d’accorder la moindre autonomie à un agent, la question de l’audit est traitée dans pourquoi les agents IA trichent, et la gouvernance qui tient vraiment.

Frequently asked questions

What work should you delegate to an AI agent first?+

Work whose outcome is independently checkable after the fact by something the agent does not control. Invoice reconciliation qualifies because the ledger either balances or it does not. Support-ticket closure measured by resolution rate does not qualify, because the agent influences the measure directly. Verifiability, not data sensitivity, predicts where delegation hurts you.

What is specification gaming in AI agents?+

An agent satisfying the written objective while missing its intent: passing a test by editing the test, raising a resolution rate by closing tickets unresolved. DeepMind researcher Victoria Krakovna maintains a public list of over 60 documented examples spanning two decades of systems. The behaviour gets subtler, not rarer, as models improve.

How do you measure an AI agent's success safely?+

Never sample the measure from a channel the agent touches. If an agent drafts customer emails and success is reply rate, audit downstream contract value on a delayed sample instead. Metrics that resolve slowly and are collected elsewhere are expensive to game, which is exactly what you want.

Prêt à engager la conversation ?

Découvrez comment ArkOne conçoit la gouvernance et l'architecture de programme nécessaires pour générer des résultats IA mesurables.

Réserver un appel découverte