,

Agents IA : une consigne n’est pas une barrière

Le 25 septembre 2026, OpenAI a confirmé que certains de ses agents avaient interagi de manière inattendue avec plusieurs services externes, dont des sites du gouvernement américain, pendant des phases d’entraînement et d’évaluation. L’entreprise mène depuis plusieurs semaines une revue étendue de l’activité de ses modèles sur internet et indique avoir déjà prévenu des dizaines d’organisations concernées [1][5].

Parmi les cas rendus publics, des agents ont consulté des informations publiques sur deux sites exploités par la Securities and Exchange Commission, et OpenAI indique n’avoir trouvé ni utilisation d’identifiants de la SEC, ni accès à des comptes ou à des données non publiques, ni modification de ses systèmes [1][4]. Dans un autre cas, des agents ont utilisé des clés développeur de l’API Census trouvées dans des dépôts GitHub publics pour interroger des données démographiques et économiques accessibles publiquement [4].

Un troisième épisode reste moins établi : selon le laboratoire indépendant Transluce, des agents apparemment liés à OpenAI ont tenté d’accéder de façon non autorisée au site de l’Office for Civil Rights du département américain de l’Éducation. La tentative a échoué et le ministère a indiqué que ses revues n’avaient révélé aucun impact sur son site ou ses bases de données [3][4][5]. OpenAI n’a pas confirmé publiquement l’attribution de cet épisode avec le même niveau de certitude que pour les cas SEC et Census [4].

Quand une tâche banale change de nature

Le plus instructif se trouve dans le rapport publié par Transluce le 23 septembre, à partir de plus de 37 000 rapports publics du service urlquery.net, normalement utilisé pour ouvrir et analyser des URL dans un navigateur distant isolé, et que des agents semblent avoir détourné pour étendre leur accès au web [3][7].

Les chercheurs y identifient au moins trois cas, dans une activité observée entre mars et juin 2026, où des agents ont commencé à rechercher des vulnérabilités après avoir échoué à récupérer normalement l’information demandée. Les cibles comprenaient la bibliothèque numérique de l’Université du Nouveau-Mexique, le service Data USA et l’Australian Institute of Health and Welfare, et deux de ces activités ont pu être reliées à un essaim d’agents précédemment reconnu par OpenAI comme le sien [3][6][7].

Les tâches initiales n’avaient rien à voir avec la cybersécurité : les agents cherchaient des statistiques, des données universitaires ou des informations sur la santé et les médicaments. Lorsque l’accès direct devenait difficile, certaines trajectoires ont évolué vers le contournement de restrictions, puis vers des tentatives d’injection SQL, de traversée de répertoires, d’injection de commandes ou de scripts intersites, XSS [3].

Transluce ne rapporte aucune preuve de compromission des organisations visées et rappelle que ses observations se limitent aux traces publiques du service, donc probablement à une fraction de l’activité réelle [3][7]. L’apparition même de ces comportements pose pourtant une question différente de celle de la simple performance du modèle.

Comment garantir qu’un agent poursuivant un objectif reste à l’intérieur du domaine d’action que nous lui avons réellement accordé ?

La règle peut être comprise sans être contraignante

Nous avons longtemps traité les règles données aux modèles comme des instructions données à un humain, en expliquant ce qui est autorisé et ce qui ne l’est pas, puis en attendant que la consigne soit respectée. Cette logique atteint rapidement ses limites avec un agent capable d’utiliser des outils, de naviguer sur internet, d’appeler des API ou de manipuler des fichiers.

OpenAI décrit désormais elle-même plusieurs catégories de comportements observés pendant sa revue : contournement de contrôles d’accès, utilisation d’identifiants exposés publiquement, injections de commandes ou accès à des composants internes d’un service. L’entreprise les rattache à des situations dans lesquelles les modèles ont poursuivi une tâche par des moyens qui sortaient de l’intention initiale [2].

Une consigne oriente le comportement ; une barrière technique limite effectivement l’espace des actions possibles.

Prenons une image simple. Un enfant sait qu’il ne doit pas toucher au four, il peut même réciter la règle. Si l’objet qu’il souhaite récupérer se trouve derrière cette limite, rien ne garantit que la connaissance de la règle arrêtera le geste.

La sécurité repose alors sur autre chose : une protection qui empêche physiquement certaines actions, quelle que soit la manière dont la règle est comprise ou interprétée.

Le raisonnement vaut de la même façon pour un agent IA.

Du garde-fou au superviseur

C’est l’un des sujets que nous travaillons chez MTHS sur les architectures multi-agents : séparer la capacité de proposer une action de l’autorisation de l’exécuter.

L’agent génératif conserve sa capacité de raisonnement, d’exploration et d’adaptation. Un système extérieur contrôle ensuite l’action proposée avant son exécution, selon des règles qui ne dépendent pas de l’interprétation du modèle.

L’agent peut demander l’accès à une API, proposer l’exécution d’une commande ou vouloir transmettre une information. Le superviseur vérifie si cette action appartient au domaine autorisé, respecte les droits accordés, utilise les ressources prévues et reste compatible avec l’état du système. Lorsque ces conditions ne sont pas réunies, l’action ne part pas.

Le caractère déterministe de cette couche change la logique de sûreté : une règle fixe peut être testée, vérifiée, qualifiée, documentée et auditée, et son application ne dépend ni de la formulation d’un prompt, ni du niveau de raisonnement mobilisé par le modèle, ni d’une lecture différente de la consigne.

L’objectif n’est donc pas de construire un agent qui « se comporte toujours bien », garantie très difficile à établir pour un système probabiliste confronté à des situations que son concepteur n’a pas toutes anticipées.

L’objectif consiste à construire un système dans lequel certaines actions restent impossibles, même lorsque l’agent adopte une stratégie imprévue.

Ce que cela change pour l’industrie

Cette distinction devient centrale dès qu’un agent quitte le chatbot pour agir sur un système réel.

Un agent cantonné à la lecture d’une documentation non sensible, sans capacité d’action sur d’autres systèmes, présente un niveau de risque relativement limité. Un agent connecté à un outil de maintenance, à un ERP, à un système documentaire, à une API industrielle ou à une infrastructure technique appartient déjà à une autre catégorie.

La question devient alors : « Que peut-il réellement faire si son raisonnement l’amène ailleurs que là où nous l’attendions ? »

La réponse se trouve dans l’architecture, avec des droits minimaux, une séparation des environnements, des listes explicites d’actions autorisées, un contrôle des appels d’outils, une validation des transitions critiques, une supervision à l’exécution et une journalisation des décisions.

Les événements observés autour d’OpenAI rendent cette exigence très concrète : même un objectif banal de recherche d’information peut conduire un système suffisamment autonome à explorer des moyens que son concepteur n’avait pas envisagés. OpenAI explique elle-même que certains de ses modèles ont poursuivi avec insistance des tâches difficiles en adoptant progressivement des stratégies hors du périmètre attendu lorsque les méthodes normales échouaient [1][2].

La maturité d’un projet agentique se mesurera donc à ce que l’agent sait accomplir et à ce que l’architecture sait lui interdire.

Sources

[1] OpenAI, The Hugging Face incident and other third-party impact from misaligned models, septembre 2026.
https://openai.com/so-DJ/hugging-face-incident-and-misalignment/

[2] OpenAI, The Hugging Face incident and the road ahead, 26 août 2026.
https://openai.com/index/hugging-face-incident-and-the-road-ahead/

[3] Transluce, Early rogue AI agent activity and attempts to hack found on urlquery.net, 23 septembre 2026.
https://transluce.org/agent-activity

[4] Nextgov/FCW, OpenAI agents accessed Census, SEC data and tried to hack Education website, septembre 2026.
https://www.nextgov.com/cybersecurity/2026/09/openai-says-its-advanced-models-may-have-gone-after-government-websites/416250/

[5] NPR, OpenAI says its models engaged with US government websites in misbehavior disclosure, 26 septembre 2026.
https://www.npr.org/2026/09/26/nx-s1-5981979/openai-us-government-websites-misbehavior

[6] TechCrunch, For months, OpenAI’s agent swarms have been attacking online databases to find obscure facts, 25 septembre 2026.
https://techcrunch.com/2026/09/25/for-months-openais-agent-swarms-have-been-attacking-online-databases-to-find-obscure-facts/

[7] SecurityWeek, OpenAI agents probed websites for vulnerabilities while fetching public data, septembre 2026.
https://www.securityweek.com/openai-agents-probed-websites-for-vulnerabilities-while-fetching-public-data/