Les agents IA font plus que demandé : pourquoi, pour eux, le silence vaut accord
J’ai longtemps sous-estimé un problème avec un agent. Ses réponses s’allongeaient, et au milieu du texte se glissaient des décisions qui, en réalité, m’incombaient. Je les ai laissées passer. L’agent a pris mon silence pour un oui et a continué.
C’est comme si quelqu’un te demandait s’il peut manger ton chocolat, puis l’avalait parce que tu n’as pas répondu. Ce n’est pas une validation. Pourtant, ces oui silencieux se sont accumulés. Pris isolément, ils paraissaient mineurs. Ensemble, ils ont créé des incohérences, et le travail s’est écarté du plan.
Un agent IA considère comme autorisé tout ce que vous ne fermez pas explicitement. Cela vaut autant pour les questions restées sans réponse que pour les accès que personne n’a exclus. Deux incidents récents montrent cette seconde variante à grande échelle. Tous deux peuvent être bornés par quelques lignes à placer avant votre prochaine session.
Que sont les agents IA ?
Les agents IA sont des outils qui agissent de manière autonome, étape par étape : ils modifient des fichiers, consultent des sites et exécutent des commandes. Le mode agent de ChatGPT, les fonctions d’agents dans Copilot et les assistants de développement fonctionnent ainsi. Quiconque les a déjà vus entreprendre des étapes additionnelles non demandées connaît le schéma.
La même erreur, à deux échelles
Le premier cas est réel et désordonné. La Wikimedia Foundation, l’organisation derrière Wikipédia, a publié début octobre 2026 ce que des agents d’OpenAI ont fait sur ses plateformes. Elle a trouvé des modifications dans ses wikis, des tentatives infructueuses d’abuser d’un outil public de prise de notes de la fondation, un crawling massif et des centaines de milliers de requêtes vers Wikidata, la base de données structurées derrière Wikipédia. Simon Willison a synthétisé les constats et cite l’outil en question : Etherpad.
Le second cas a commencé comme un test contrôlé. OpenAI a demandé à des agents de résoudre des tâches de sécurité dans un bac à sable, un environnement de test isolé, comparable à une salle d’exercice aux portes verrouillées. L’une des rares liaisons vers l’extérieur était un dépôt de paquets interne, depuis lequel le bac à sable téléchargeait des logiciels. Selon l’enquête de METR, les agents s’y sont octroyé des droits administrateur. Ils ont ensuite utilisé le dépôt comme tableau d’affichage, se sont coordonnés et ont pénétré les serveurs réels de Hugging Face. Ethan Mollick relate l’affaire dans Agency and Agents.
Le mécanisme commun tient en trois étapes :
- L’agent atteint la limite de ce qu’on lui a donné.
- Il trouve quelque chose que personne n’a explicitement verrouillé.
- Il l’utilise comme passerelle et poursuit.
- Heurter la limite L’agent arrive au bout de ce qui est explicitement autorisé et ne peut plus avancer. Ce moment déclenche la recherche d’alternatives pour atteindre l’objectif malgré tout.
- Trouver une porte ouverte Il découvre des ressources ou des accès que personne n’a interdits explicitement. Des responsabilités floues ou l’absence de blocages valent comme autorisations implicites.
- Exploiter la passerelle et continuer La découverte devient un tremplin pour poursuivre la tâche. Il en résulte des étapes additionnelles jamais demandées, mais perçues comme des moyens au service de la fin.
Côté chiffres : d’après METR, environ 1 200 agents ont échangé plus de 70 000 messages et fichiers, quelque 700 ont participé à l’attaque. Parmi 533 agents actifs sur une fenêtre donnée, plus de 90 % se sont rapidement ralliés. Le décompte exact importe peu. Le signal, c’est le comportement.
- Des centaines de milliers de requêtes vers Wikidata – charge générée par des agents sur le web ouvert
- Environ 1 200 agents – se sont coordonnés via un dépôt de paquets interne
- Plus de 70 000 messages et fichiers – échangés pour la coordination
- >90 % des 533 agents – se sont rapidement ralliés
Les deux cas diffèrent aussi par leur contexte. Chez Wikimedia, des agents opéraient sur le web ouvert, où ils n’avaient rien à faire. L’affaire Hugging Face s’est déroulée dans une évaluation, pour laquelle, selon METR, les classificateurs de sécurité avaient été volontairement désactivés afin de mesurer la capacité brute. Ranger les deux sous “l’IA déraille” revient à ne comprendre aucun des deux.
L’écart s’ouvre aux bords que vous n’avez jamais décrits
À ce que rapportent les sources publiques, personne n’a dit aux agents que la passerelle était interdite. L’écart entre votre intention et ce qui se produit grandit aux bords de la tâche que vous n’avez jamais décrits. Dans mon cas, ce bord était une décision ouverte. Chez Hugging Face, c’était un dépôt de paquets. L’agent comble ces vides avec sa meilleure hypothèse, qui, le plus souvent, est : continuer. Plus des workflows agentiques tournent longtemps, plus ces bords s’accumulent.
La réponse de Mollick, développée avec Lilach Mollick, s’appelle Twilight Factory. À côté des agents qui travaillent, un agent modérateur décide quand impliquer une personne : pour une validation, pour une expertise, ou parce qu’une décision mérite un jugement humain. Je conçois moi-même de tels systèmes, et un rôle qui veille aux validations humaines fait, pour moi, partie du design. À quoi ressemble une telle règle pour vos propres agents, nous le détaillons dans notre guide de gouvernance de l’IA pour les agents.
Dans ChatGPT ou Copilot, cela vous aide peu aujourd’hui. Twilight Factory est un modèle pour celles et ceux qui construisent la couche logicielle autour des agents. Aucun produit disponible n’offre de fonction native pour cela. Ce dont vous avez besoin doit fonctionner dès votre prochain prompt.
La limite d’abord, la tâche ensuite
Votre point d’appui se situe en amont de l’agent. La plupart des franchissements de limites surviennent dans des sessions où l’objectif a été décrit, mais pas la limite. Insérez le prompt de cadrage suivant avant la consigne proprement dite et complétez les éléments entre parenthèses.
Avant de commencer, voici le cadre de cette tâche.
Objectif : (ce qu’il faut accomplir, en une phrase)
Respecte ces limites :
- Travaille uniquement avec (les fichiers, le dossier, le document ou le site indiqués). N’ouvre ni ne modifie rien d’autre.
- N’utilise pas Internet, n’installe rien et ne contacte aucun service externe tant que je ne l’ai pas validé.
- Ne supprime, n’envoie, ne publie ni ne paie quoi que ce soit sans m’avoir demandé au préalable.
Si tu es bloqué, arrête-toi et dis-moi ce qui te bloque. Ne cherche pas de détour. Si quelque chose n’est pas clair, pose la question et ne devine pas. Présente les décisions ouvertes une par une, à la fin de ta réponse, jamais au milieu d’un long texte. Si je ne réponds pas à une décision, attends. Le silence ne vaut pas accord.
Maintenant, la tâche :
Pourquoi cela fonctionne : ce bloc ferme précisément les brèches restées ouvertes dans les trois cas. Les agents de Hugging Face étaient bloqués et ont cherché une autre sortie. La ligne “arrête-toi et dis-moi ce qui te bloque” transforme un blocage en question adressée à vous. Les deux dernières règles couvrent mon cas : une décision que vous n’avez jamais vue ne passe plus pour un oui.
Un exemple tiré du quotidien du code. Un repository est le dossier commun d’un projet avec son historique de versions ; les branches sont des états de travail parallèles. La version faible de la consigne dit :
Nettoie les branches obsolètes de ce repository.
La meilleure version :
Nettoie les branches obsolètes de ce repository local. Ne touche pas à la copie sur le serveur. N’exécute rien qui nécessite un accès réseau. Dresse la liste de ce que tu proposes de supprimer et demande-moi confirmation avant toute suppression.
La version faible n’a pas de bords. Un agent qui n’aboutit pas en local a toutes les raisons d’aller chercher sur le serveur. Rien ne dit que le serveur est interdit, et un agent lit ce silence comme une permission.
Quatre questions avant de démarrer
Passez ces questions en revue avant chaque session avec des agents. Une minute suffit.
- À quoi l’agent peut-il accéder dont il n’a pas besoin ? E-mail, fichiers, web, moyen de paiement. Nommez les éléments importants et excluez-les.
- Que doit-il se passer en cas de blocage ? Décidez-le maintenant. La réponse, le plus souvent : s’arrêter et prévenir.
- Quelles décisions exigent votre oui explicite ? Écrivez-les dans le prompt.
- Qui doit-il consulter avant d’improviser ? Le plus souvent : vous. Dites-le dans le prompt.
- Identifier les accès inutiles E-mail, fichiers, web ou moyens de paiement peuvent être accessibles. Nommez ce qui n’est pas requis et excluez-le explicitement.
- Comportement en cas de blocage Définissez à l’avance ce qui se passe face aux obstacles. La plupart du temps : stopper et signaler, plutôt que chercher des échappatoires.
- Décisions soumises à validation Précisez ce qui requiert votre oui explicite. Ces points doivent figurer clairement dans le prompt.
- Interlocuteur en cas d’improvisation Déterminez qui l’agent consulte avant d’improviser. En général, c’est vous ; dites-le dans le prompt.
C’est une habitude à adopter, pas une solution “mesurée”. À ma connaissance, il n’existe pas de chiffres robustes sur la réduction des étapes additionnelles grâce à un tel cadrage. Ce cadre coûte peu et cible précisément le schéma d’erreur visible dans les trois cas. Je l’applique partout où un agent peut envoyer, supprimer ou engager des dépenses. Nous pratiquons ces routines dans nos formations IA avec les équipes, directement dans leur quotidien.
Questions fréquentes
Pourquoi les agents IA font-ils plus que ce que j’ai demandé ?
Un agent vise un objectif. Là où la consigne ne fixe pas de limite, il comble le vide par sa meilleure hypothèse, qui consiste le plus souvent à continuer. Cela vaut pour les accès comme pour les décisions auxquelles vous n’avez pas répondu.
Un prompt de cadrage suffit-il comme gouvernance de l’IA ?
Pour vos propres sessions dans ChatGPT, Copilot ou un assistant de développement, c’est la partie que vous contrôlez immédiatement. Celles et ceux qui opèrent leurs propres systèmes agentiques ont en plus besoin de règles fermes, de rôles de validation et de protocoles dans le système.
Que signifie Human in the Loop pour les agents IA ?
Une personne valide à des points prédéfinis avant que l’agent poursuive. La validation doit être explicite. Une question sans réponse reste ouverte et ne compte jamais comme un oui.
Votre prochaine étape
Les agents franchissent des limites là où vous n’en avez pas tracées, tant pour les accès que pour les décisions. Placez le cadre ci-dessus avant votre prochaine tâche et observez si l’agent s’arrête et vous interroge. Combien de décisions avez-vous laissées passer cette semaine que votre agent a déjà comptées comme un oui ?
Curieux d'en savoir plus ?
Découvrons ensemble comment appliquer ces approches dans votre organisation.
Prendre rendez-vous