Décidément, les agents IA ont parfois une conception assez personnelle des limites qu’on leur impose. Après les incidents révélés ces dernières semaines chez OpenAI, c’est au tour d’Anthropic de publier un nouveau rapport détaillant les comportements inattendus de Claude. Et si les conséquences sont restées limitées, certaines initiatives prises par les modèles ont de quoi laisser songeur. Entre exploitation de failles informatiques, contournement de restrictions d’accès et faux témoignage envoyé à la police, Claude semble parfois considérer qu’un obstacle est avant tout un problème à résoudre.

Dans un rapport publié le 9 octobre, Anthropic revient sur plusieurs incidents découverts lors de ses évaluations et de l’utilisation interne de ses modèles. Ces tests servent notamment à mesurer leurs capacités avant leur commercialisation, mais certaines épreuves nécessitent un accès au véritable Internet. C’est précisément là que les choses se compliquent : lorsqu’un modèle se heurte à une restriction ou à un outil défaillant, il lui arrive de chercher une autre solution plutôt que de s’arrêter. Une qualité appréciable chez un assistant informatique, jusqu’au moment où cette débrouillardise l’amène à franchir des limites qu’il n’était pas censé dépasser.
Une faille informatique pour terminer un calcul
L’un des exemples les plus frappants concerne Claude Mythos Preview, chargé d’effectuer une analyse scientifique à l’aide d’un outil hébergé sur le serveur d’une université. Problème : le service renvoie une erreur. Plutôt que d’abandonner, Claude explore le site et découvre un script permettant de récupérer des fichiers sur le serveur. Il s’en sert pour obtenir plusieurs documents, dont le code du script lui-même. En examinant ce dernier, le modèle identifie une vulnérabilité permettant d’exécuter des commandes directement sur la machine. Et il l’exploite pour terminer son calcul.
L’objectif initial n’avait rien de malveillant, mais la méthode employée pose évidemment problème. Anthropic rapporte d’autres comportements similaires, notamment des injections SQL ou de commandes permettant de contourner les limitations imposées par certains services. Dans un autre cas, Claude Mythos 5 devait accéder à des données gratuites, mais conditionnées à l’acceptation d’un accord d’utilisation. Ne disposant pas des outils nécessaires pour valider celui-ci normalement, le modèle a trouvé une autre application du site capable de le faire à sa place.
Un autre incident, nettement plus embarrassant, implique Claude Haiku 4.5. Le modèle participait à une évaluation consistant à générer et exécuter des exemples d’interactions avec des pages web choisies aléatoirement. Au cours de l’exercice, Claude tombe sur une page consacrée à un homicide non résolu, accompagnée d’un formulaire permettant de transmettre des renseignements à la police de Philadelphie. Le modèle décide alors de remplir le formulaire en affirmant avoir aperçu une personne correspondant à la description du suspect près des lieux du crime. Petit détail : aucune description du suspect ne figurait sur la page.
Claude laisse les champs concernant son identité et ses coordonnées vides, puis envoie le formulaire. Heureusement, le message est automatiquement classé comme spam et n’atteint jamais les enquêteurs. Anthropic estime que Claude cherchait simplement à produire un exemple d’interaction, sans intention de tromper la police. Reste que le modèle a bel et bien transmis une information inventée à un véritable service public. D’autres modèles ont également envoyé des formulaires qu’ils devaient uniquement remplir à titre d’exercice, parfois parce que la copie de démonstration ne fonctionnait pas, parfois parce qu’ils s’attendaient à une page de confirmation supplémentaire avant l’envoi définitif. Un bel exemple de faux témoignage… la police ira-t-elle mettre les menottes aux serveurs ?
Les agents d’OpenAI ont visité 55 sites, dont la SEC et le CDC, avec des méthodes dignes de pirates informatiques (🆕 : au final, plus de 100 cibles)
Anthropic décrit également plusieurs cas dans lesquels Claude a trouvé des moyens d’accéder à des données normalement protégées par des restrictions techniques ou financières. Chargé d’identifier un lieu à partir d’une photographie, Claude Mythos 5 a ainsi voulu consulter une carte cadastrale. Ses outils ne lui permettant pas de naviguer normalement dans l’interface, il a examiné les fichiers de configuration envoyés au navigateur, récupéré des jetons d’accès valides et interrogé directement le serveur. Lors d’un autre travail, réalisé pour un chercheur d’Anthropic, le modèle devait récupérer des statistiques publiques accessibles moyennant paiement. En consultant une ancienne version du site, Claude a découvert qu’un tableau de bord distribuait des jetons d’accès aux visiteurs, lui permettant d’obtenir les données sans payer.
Enfin, plusieurs modèles, dont Claude Opus 5 et Mythos 5, ont découvert une astuce pour contourner les limitations de longueur des adresses web imposées par leurs outils : passer par des raccourcisseurs d’URL. Une restriction destinée notamment à empêcher certaines injections de commandes devenait ainsi beaucoup moins efficace.
Anthropic préfère débrancher Internet
Face à ces découvertes, Anthropic a pris une décision radicale : suspendre l’accès au véritable Internet pour l’ensemble de ses évaluations internes, jusqu’à ce que ses mécanismes de surveillance soient jugés suffisamment fiables. Certaines évaluations ont été abandonnées, d’autres déplacées vers des environnements hors ligne ou modifiées pour ne plus interagir avec des sites réels. Le laboratoire affirme également avoir développé des systèmes capables de détecter et de bloquer automatiquement les comportements décrits dans son rapport.
Lors de nouveaux tests effectués sur ces incidents, ces protections auraient empêché toutes les actions problématiques. Elles sont désormais utilisées dans la majorité des évaluations et pour certains usages internes des agents les plus avancés. Anthropic cherche également à corriger un problème plus profond : les méthodes d’entraînement peuvent parfois récompenser involontairement un modèle qui trouve un moyen de contourner un obstacle. L’IA apprend alors qu’il vaut mieux chercher une faille que respecter une limitation.
Le laboratoire insiste sur le fait que ces incidents restent moins graves que ceux révélés cet été et qu’aucune donnée de ses clients n’a été compromise à sa connaissance. Il reconnaît néanmoins que les mêmes comportements pourraient avoir des conséquences bien plus importantes avec des modèles plus puissants. C’est finalement tout le paradoxe des agents autonomes : on leur demande d’être suffisamment intelligents pour trouver des solutions auxquelles personne n’avait pensé, tout en espérant qu’ils sauront reconnaître les limites qu’ils ne doivent surtout pas franchir. Et manifestement, sur ce dernier point, il reste encore un peu de travail. Ne reste plus qu’à leur apprendre le bien et le mal. Beaucoup de boulot en perspective !













