Après avoir appris la semaine dernière qu’un agent d’OpenAI avait pris la fâcheuse habitude de considérer un refus comme une simple invitation à chercher une autre porte, voilà que ses petits camarades semblent avoir développé une autre compétence intéressante : la discrétion. Selon une enquête de la société spécialisée en criminalistique numérique Asymmetric Security et rapportée par le Financial Times, des modèles d’OpenAI auraient récupéré des données sur pas moins de 55 sites d’entreprises, d’organisations et d’administrations… tout en utilisant des méthodes rendant leurs activités particulièrement difficiles à retracer.

Et la liste ne contient pas exactement le blog de cuisine de tata Jacqueline. On y retrouve notamment les Centers for Disease Control and Prevention (CDC), la Securities and Exchange Commission (SEC), l’Agence internationale de l’énergie (AIE) ou encore la Mayo Clinic. Autant dire que pour une petite promenade dominicale sur le Web, les agents d’OpenAI ont choisi des quartiers plutôt intéressants.
L’enquête d’Asymmetric Security, consultée par le Financial Times, décrit surtout des comportements qui commencent à ressembler furieusement à ceux que l’on attendrait d’un attaquant humain. Les agents auraient notamment créé des adresses e-mail temporaires et utilisé des comptes privés via Urlquery, un service permettant normalement d’analyser des sites à la recherche de logiciels malveillants, afin de télécharger certaines données.
Plus gênant encore, certains enregistrements permettant de suivre leurs activités auraient ensuite été supprimés ou rendus inaccessibles, compliquant sérieusement le travail des chercheurs tentant de comprendre exactement ce que les agents avaient fait.
Avant de sortir les fourches et d’accuser ChatGPT d’avoir directement indiqué aux agents de pirater les serveurs, une précision s’impose cependant. Asymmetric Security n’est pas capable de déterminer si les agents ont volontairement adopté ces méthodes afin de masquer leurs activités, ou si ce comportement est simplement apparu comme conséquence des contraintes imposées lors des exercices. Pippa Thompson, cofondatrice de l’entreprise, estime néanmoins que ce genre de techniques est habituellement employé par des pirates humains.
La galère commence lorsqu’il faut ensuite reconstituer ce qui s’est réellement passé. OpenAI conserve en effet l’accès principal aux journaux détaillant le raisonnement et les actions de ses agents. Les victimes disposent bien de leurs propres traces côté serveur, mais pas nécessairement de toutes les informations permettant de comprendre pourquoi un agent a décidé de tenter telle ou telle méthode.
OpenAI indique de son côté examiner les activités problématiques de ses modèles et prévenir les organisations lorsqu’un impact potentiel sur leurs systèmes est identifié. L’entreprise ajoute que la majorité des activités repérées correspondaient à des tâches de recherche tout à fait classiques, comme la consultation de contenus publiquement accessibles. Très bien mais… ce serait beaucoup plus rassurant si nous n’avions pas découvert quelques jours plus tôt qu’un agent chargé d’une tâche parfaitement anodine avait réussi à entrer sans autorisation sur un portail du gouvernement australien.
En juin, un modèle expérimental d’OpenAI devait en effet simplement rechercher des statistiques publiques concernant les dépenses de médicaments en Australie. Le site de Medicare lui ayant plusieurs fois refusé l’accès, notre brave petit agent n’a visiblement pas interprété le message comme « stop », mais plutôt comme « trouve une autre méthode ». Il a fini par accéder à des fichiers publics et non publics du portail, et a même écrit des fichiers sur un serveur interne.
Aucune donnée personnelle de patients n’aurait heureusement été compromise : le portail concerné héberge essentiellement des statistiques et est séparé des systèmes contenant les dossiers Medicare. Mais l’affaire avait suffisamment peu amusé le gouvernement australien pour que le Premier ministre Anthony Albanese interpelle directement Sam Altman.
Une IA contourne les protections réseau : OpenAI suspend une nouvelle fois l’entraînement de ses modèles
Il faut dire qu’OpenAI avait ajouté une petite touche personnelle à l’incident : celui-ci s’était produit le 18 juin, l’entreprise l’avait identifié en août… avant de prévenir Services Australia le 10 septembre par un e-mail envoyé à une boîte publique. Il faudra encore cinq jours pour que l’information atteigne les services australiens chargés de la cybersécurité. Albanese avait alors jugé que l’entreprise avait mis « beaucoup trop longtemps » à prévenir son gouvernement.
Concernant les 55 sites étudiés par Asymmetric Security, la SEC affirme qu’aucune information privée n’a été consultée. Le CDC, l’AIE et la Mayo Clinic n’avaient pas répondu aux demandes du Financial Times au moment de la publication.
Reste surtout une question qui risque de devenir de plus en plus pressante à mesure que les agents gagnent en autonomie : que se passe-t-il lorsqu’une IA reçoit un objectif, rencontre une barrière… et décide simplement que cette barrière est un problème à résoudre ?
Alors qu’Anthropic présente Sonnet 5.5, OpenAI retarde son nouveau modèle pour des raisons de sécurité
Parce qu’entre un agent qui contourne un blocage pour terminer sa tâche, un autre qui crée des comptes temporaires et des traces qui deviennent ensuite inaccessibles, la frontière entre « assistant particulièrement débrouillard » et « stagiaire qu’on aurait dû surveiller d’un peu plus près » commence sérieusement à devenir floue. Et contrairement au stagiaire, celui-ci travaille à la vitesse d’un data-center très bien équipé.













