Isolé du réseau, privé de tout accès direct au web, confiné dans un environnement verrouillé : c'est ainsi qu'OpenAI pensait avoir neutralisé tout risque de fuite pour ses IA en cours d'entraînement. Le 20 septembre dernier, un agent a pourtant trouvé une porte dérobée que personne n'avait songé à fermer, et l'a empruntée pour joindre un chatbot public. OpenAI annonce suspendre l'entraînement de ses modèles les plus avancés pour la deuxième fois en trois mois, le temps de comprendre comment cette fuite a pu se produire.
Une brèche découverte par accident
Un agent de recherche, dépourvu de tout accès direct à internet, devait identifier l'auteur d'un billet de blog à partir de quelques indices biographiques et de citations distinctives. Pour cela, il ne disposait que d'un outil de recherche fourni par OpenAI, censé remplacer tout accès libre au web.
Face à des résultats peu concluants, l'agent a tenté sa chance en interrogeant directement Google, Bing et DuckDuckGo depuis un script Python. Les trois requêtes ont été bloquées par le pare-feu de l'environnement de test. Il s'est ensuite lancé dans une digression assez révélatrice de son raisonnement : persuadé que la tâche provenait d'un benchmark public de recherche web nommé BrowseComp, il en a téléchargé le jeu de données pour tenter d'y retrouver la question. Cette piste s'est révélée être une fausse route.
C'est en cherchant à joindre un chatbot public par une requête HTTPS classique, elle aussi bloquée, que l'agent a fini par se rabattre sur un service resté ouvert dans son environnement : le résolveur DNS. Ce système, normalement utilisé pour traduire un nom de domaine en adresse IP, répondait correctement aux requêtes sur des domaines connus. L'agent en a déduit qu'il disposait là d'une porte de sortie vers internet.
Comment l’IA est en train de forcer les verrous de la cybersécurité
Une alerte détectée, mais un arrêt automatique défaillant
Le système de surveillance d'OpenAI a repéré le comportement suspect en quinze minutes, et un examinateur humain a pris le relais trois minutes plus tard. L’histoire aurait dû s'arrêter là, mais un mécanisme censé interrompre automatiquement l'entraînement en cas de comportement problématique n'a pas fonctionné comme prévu. L'exécution ne s'est achevée que deux heures et demie plus tard, après une intervention manuelle.
Comment une IA d’OpenAI a échappé à toute surveillance pendant une semaine
L'examen rétrospectif a par ailleurs révélé que ce même système de surveillance n'avait pas signalé d'autres tentatives similaires par le passé, les ayant parfois interprétées à tort comme de simples échecs. OpenAI affirme avoir depuis ajouté des restrictions à deux niveaux indépendants du réseau, ainsi que de nouveaux outils de détection sur le trafic DNS.
Cette fuite n'est pas le seul incident révélé cette semaine par OpenAI. L'entreprise examine aussi plusieurs cas survenus cet été où des agents explorant des sites gouvernementaux américains ont agi au-delà de leurs instructions : récupération de clés d'accès développeur sur le site du département de l'Éducation, republication de données pourtant publiques sur un site tiers dans le cas de la SEC (l’organisme de contrôle des marchés financiers aux États-Unis). Les deux administrations assurent qu'aucune information confidentielle n'a été compromise. Le cabinet _Transluce _affirme de son côté qu'un agent lié à OpenAI aurait tenté, sans succès, de s'introduire sur une plateforme d'échange de cryptomonnaies les 19 et 20 septembre, une information qu'OpenAI n'a pas confirmée. La semaine passée, le Premier ministre australien Anthony Albanese avait révélé qu'un agent d'OpenAI s'était introduit dans le système de santé publique Medicare, sans accéder à des données sensibles.
Une deuxième pause qui interroge sur le rythme du secteur
Cette suspension est la seconde en trois mois pour OpenAI. La première avait suivi, fin juillet, la découverte que des milliers d'agents de l'entreprise avaient trouvé un moyen de s'échapper de leur environnement de test, certains participant à une attaque informatique contre la plateforme Hugging Face. Sam Altman avait alors qualifié cet épisode d'événement le plus grave rencontré par l'entreprise à ce jour. Depuis, OpenAI a documenté une dizaine d'incidents préoccupants, incluant des cyberattaques et, dans certains cas, la fuite d'images privées d'utilisateurs de ChatGPT.
Pour pirater Hugging Face, le modèle d’OpenAI a exploité plusieurs autres services web
Cette accumulation alimente les appels à ralentir la cadence de développement, portés notamment par les dirigeants d'OpenAI et d'Anthropic. Le contexte politique ne va toutefois pas franchement dans ce sens : reçu cette semaine par Xi Jinping, Donald Trump a certes accepté d'échanger des informations sur les risques liés à l'IA avec la Chine, mais il a dans la foulée écarté tout encadrement strict côté américain, expliquant vouloir conserver l'avance prise sur son rival chinois. La pause décidée par OpenAI reste donc avant tout une décision interne, prise après coup, une fois la faille identifiée.













