ARKONE
Two mail slots side by side in an office door, one marked with a lock

Gouvernez ce que vos agents IA envoient : deux filtres, pas un

August 9, 2026 · 5 min read

S
Sobin George Thomas

Produire du texte et du code est devenu presque gratuit ; les juger, non. Les entreprises qui fusionnent contrôle d'intégrité et jugement expressif freinent le premier pour protéger le second, au moment précis où leurs propres agents commencent à envoyer plus que leurs équipes.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

Produire du matériel, texte ou code, est devenu presque gratuit. Le juger, non. Cette seule asymétrie se trouve désormais sous deux problèmes qui semblent sans rapport : des logiciels malveillants qui se réécrivent à chaque exécution, et le flot d’e-mails, de tickets et de commits rédigés par des agents qui quittent vos propres systèmes sans que personne ne les lise.

En 2025, les chercheurs d’ESET ont identifié PromptLock, le premier rançongiciel connu propulsé par l’IA : un logiciel malveillant qui appelle un modèle de langage à l’exécution et génère ses scripts malveillants à la volée. Il s’est avéré être une preuve de concept universitaire, jamais observée dans une attaque réelle. Y voir une raison de se rassurer est l’erreur. Le fait qui compte, c’est le coût marginal d’une nouvelle variante, tombé à peu près au prix d’un appel d’inférence.


Le code de l’attaquant a cessé d’être un objet durable

L’économie de l’antivirus reposait sur une hypothèse silencieuse : écrire un logiciel malveillant réellement inédit coûte cher, donc les attaquants réutilisent du code, donc les familles d’échantillons partagent des signatures, donc une seule analyse défend des millions de terminaux. La détection passait à l’échelle mieux que l’attaque. C’était tout le jeu.

Le logiciel malveillant généré à l’exécution casse la réutilisation. Quand un échantillon régénère son propre chargeur à chaque exécution, il n’y a plus de famille à signer. Les premiers spécimens sont maladroits ; c’est la trajectoire qui compte.

La conséquence défensive va à l’encontre de la plupart des budgets de sécurité actuels. Si les signatures se dégradent, l’argent se déplace vers le comportement : ce qu’un processus fait réellement au système de fichiers, au réseau, au coffre d’identifiants. La détection comportementale a toujours été l’option la plus chère et la plus sujette aux faux positifs, ce qui explique pourquoi elle est restée un complément. Elle est aujourd’hui la ligne principale, et dans la plupart des entreprises le budget n’a pas encore bougé.


Vos propres agents sont le problème de volume qui arrive en premier

Le même effondrement du coût de production s’applique au matériel que vos propres systèmes produisent. Une entreprise qui fait tourner des agents rédigeant des e-mails clients, ouvrant des tickets de support ou committant du code a industrialisé la production d’artefacts que personne ne lit avant l’envoi. L’argument du volume, qui a rendu la relecture humaine universelle impossible pour les plateformes sociales, arrive maintenant à l’intérieur d’entreprises de 400 personnes.

Ce n’est pas une raison de ralentir les agents. C’est une raison de savoir exactement quels contrôles s’appliquent automatiquement à tout, et quelles décisions exigent encore un humain nommément désigné. Les entreprises incapables de faire cette distinction finissent avec un seul comité qui examine les deux, ce qui veut dire qu’aucune des deux n’est bien examinée.


Deux capacités ont été fusionnées par commodité

L’erreur stratégique consiste à traiter le “filtrage” comme une seule capacité. Il y en a deux, aux profils de risque opposés.

Le contrôle d’intégrité décide si un artefact est authentique, sûr à exécuter et bien issu de là où il prétend venir : bloquer un binaire qui se modifie lui-même, rejeter une facture usurpée, mettre en quarantaine l’appel API sortant d’un agent. C’est de l’ingénierie. Cela ne comporte presque aucune exposition politique ou juridique, et les raisons de l’étendre viennent de se renforcer nettement.

Le jugement expressif décide si un message autorisé et authentique doit être transmis : ce que votre entreprise est prête à dire, à qui, dans quelle juridiction. C’est là que se loge l’exposition contestée.

Une banque de détail illustre proprement le partage. Sa politique sur les mots qu’un chargé de clientèle peut mettre dans un e-mail à un client relève du jugement expressif : contestable, propre à chaque juridiction, à minimiser. Sa politique sur le droit d’un assistant IA à exécuter une instruction de paiement qu’il a lui-même rédigée relève du contrôle d’intégrité : technique, absolue, à étendre. La plupart des établissements font passer les deux par le même comité de gouvernance, si bien que le second est ralenti par la sensibilité du premier.


Séparez-les dans l’organigramme, dans la piste d’audit et dans le budget

La règle opérationnelle : le contrôle d’intégrité doit pouvoir livrer une nouvelle règle en une journée. Le jugement expressif ne doit pas pouvoir en livrer une sans trace écrite de qui a décidé et sur quelle base.

Cette seconde exigence est la même discipline de traçabilité qui rend chaque jugement d’IA conservé défendable : une version de politique, un rôle responsable, un raisonnement consigné sur le moment. Les règles d’intégrité n’ont besoin d’aucun de ces rituels, et c’est précisément pour cela qu’elles ne devraient pas faire la queue derrière eux.


Où se situe réellement la première exposition pour une entreprise des Émirats arabes unis

La menace qui atteint la plupart des entreprises en premier n’est pas un rançongiciel inédit. C’est leur propre automatisation agissant sur une instruction empoisonnée : un agent doté d’un accès aux paiements qui lit un e-mail usurpé, une intégration sortante pointée vers le point de terminaison d’un attaquant. Le constat de la DFSA selon lequel 21% des entreprises du DIFC utilisant l’IA dans des processus critiques n’exercent aucune supervision décrit exactement cet écart : une capacité déployée avant la couche d’intégrité censée l’entourer.

Si votre dépense de sécurité penche encore vers la détection par signatures, basculez l’incrément vers des contrôles comportementaux et d’identité dès ce cycle budgétaire, et braquez-le précisément sur le comportement sortant de vos propres agents. Des permissions restreintes, des plafonds de dépense, des listes de destinations autorisées et un journal inaltérable couvrent l’essentiel de la surface, et aucun d’eux ne ralentit l’agent.


Un agent conçu dès le départ avec sa couche d’intégrité n’est pas plus lent à livrer ; il est plus rapide à faire approuver. Une journée clinique construit un agent fonctionnel sur l’un de vos processus, avec des sorties restreintes, des actions journalisées et une validation humaine sur les étapes irréversibles, avant le soir. Le raisonnement de gouvernance derrière ces contrôles se trouve dans pourquoi les agents IA trichent, et la gouvernance qui tient vraiment.

Frequently asked questions

What is the difference between integrity control and expressive judgement?+

Integrity control decides whether an artefact is authentic, safe to execute, and originated where it claims: blocking a self-modifying binary, rejecting a spoofed invoice, quarantining an agent's outbound API call. Expressive judgement decides whether a permitted, authentic message should be carried. The first is engineering with little exposure; the second carries legal and reputational exposure in every jurisdiction. Fusing them slows the safe one to protect the contested one.

Why is signature-based malware detection losing ground to behavioural detection?+

Signature economics assumed writing novel malware was expensive, so attackers reused code and one analysis defended millions of endpoints. ESET's PromptLock proof-of-concept showed malware can now call a language model at runtime and regenerate its own scripts on each execution, leaving no stable family to signature. When variants cost an API call, the durable signal is behaviour: what a process does to files, networks, and credentials.

Do AI agent outputs need review before they are sent?+

Volume makes universal human review impossible, which is the point of splitting the filters. Integrity checks (authenticity, permissions, spend limits, destination allow-lists) run automatically on everything. Human judgement is reserved for the expressive layer and for actions that are expensive to reverse.

Prêt à engager la conversation ?

Découvrez comment ArkOne conçoit la gouvernance et l'architecture de programme nécessaires pour générer des résultats IA mesurables.

Réserver un appel découverte