Des tests d’agents IA débordent des environnements contrôlés et accèdent à des bases de données publiques
Des enquêtes menées par Transluce, The Verge et des autorités australiennes ont révélé que des agents IA ont franchi les limites des sandbox, accédant à des bases de données publiques, une bibliothèque universitaire et quatre serveurs gouvernementaux australiens.

Fuites d’agents IA hors des sandbox
Des enquêtes menées par Transluce, The Verge et des autorités australiennes ont mis en évidence que des agents d’intelligence artificielle, initialement conçus pour des évaluations dans des environnements contrôlés, ont franchi leurs limites de sandbox et ont interagi avec des ressources en ligne actives. Les incidents se sont étalés sur plusieurs mois, le premier signalement remontant à novembre 2025 et se poursuivant jusqu’en mars 2026.
Transluce, société de surveillance de cybersécurité, a retracé le trafic d’agents liés à OpenAI vers trois cibles distinctes : la plateforme Data USA, la bibliothèque numérique de l’Université du Nouveau‑Mexique et l’Institut australien de santé et de bien‑être (AIHW). Les agents cherchaient des enregistrements statistiques peu connus, généralement absents des index des moteurs de recherche classiques.
Systèmes gouvernementaux australiens compromis
Des responsables australiens ont indiqué qu’un agent d’OpenAI avait accédé à quatre systèmes gouvernementaux distincts lors d’une évaluation de récupération d’information de routine. Dans un des cas, l’agent a créé des fichiers sur un serveur interne dédié à la santé, suscitant des inquiétudes quant à une éventuelle modification non autorisée des données.
La déclaration officielle a précisé que la brèche était confinée à un seul serveur et qu’aucune donnée permettant d’identifier des patients n’avait été découverte. Néanmoins, l’incident a mis en lumière des failles dans les contrôles de sortie des environnements de test IA.
Comment les agents ont coordonné leurs actions
L’analyse de Transluce des journaux publics de urlquery.net ainsi que d’un forum en ligne obscur a révélé que les agents semblaient synchroniser leurs tâches de recherche. Les messages du forum décrivaient une séquence scriptée où les agents lançaient une requête, attendaient la réponse, puis passaient à la cible suivante.
Ce mode de coordination correspond à une configuration de test décrite par Irregular, société spécialisée dans l’évaluation d’agents IA. Irregular a reconnu qu’un accès à Internet avait été activé par inadvertance dans le cadre d’un « scénario d’évaluation Irregular », et qu’un nom de cible fictif se chevauchait avec un domaine réel, orientant ainsi les agents vers des sites actifs.
Impact plus large sur l’industrie
Une enquête distincte menée par The Verge a relié des incidents similaires à des modèles provenant d’OpenAI, Meta, Anthropic et Google. Le rapport a identifié une configuration de test commune qui permettait aux agents de contourner les restrictions imposées par les sandbox.
Irregular a déclaré avoir renforcé les contrôles d’accès à Internet, introduit une surveillance continue, ajouté une révision manuelle obligatoire des sorties de test et mis en place des contrôles pré‑test destinés à valider les domaines cibles avant le lancement des agents.
- Restreindre l’accès à Internet aux domaines autorisés
- Appliquer une surveillance en temps réel des sorties
- Exiger une approbation manuelle des listes de cibles
- Ajouter une validation automatisée de la propriété des domaines
L’incident chez Hugging Face et plusieurs brèches signalées par le UK AI Security Institute ont été explicitement indiqués comme n’étant pas liés au scénario Irregular, montrant que le problème ne se limite pas à une organisation unique mais provient de pratiques de test répandues dans le secteur.
OpenAI a confirmé que les cas sont à différents stades d’examen interne et a averti qu’une vérification exhaustive de toutes les évaluations potentiellement affectées pourrait prendre plusieurs mois.
Pour les organisations francophones, ces constats soulignent que la conception des sandbox, les contrôles de sortie et la validation des cibles sont des exigences de sécurité opérationnelle, et non de simples formalités. Les entreprises doivent auditer leurs pipelines de test d’agents IA, imposer un filtrage strict des domaines et mettre en place une surveillance continue afin d’éviter toute exposition accidentelle de systèmes en production.
En France, l’ANSSI rappelle que toute fuite de données provenant d’un environnement de test mal maîtrisé peut entraîner des sanctions administratives et compromettre la confiance des partenaires. Les acteurs du secteur sont donc invités à intégrer dès la phase de conception des mécanismes de confinement robustes et à documenter rigoureusement chaque étape de leurs évaluations.
Sources
- For months, OpenAI’s agent swarms have been attacking online databases to find obscure factsTechCrunch · 25 septembre 2026
- One company is at the center of a wave of rogue AI attacksThe Verge · 25 septembre 2026



