Ouvrir le menu principal

MacGeneration

Recherche

Claude n’aime pas qu’on lui dise non, Anthropic révèle de nouveaux dérapages de ses IA

Greg Onizuka

samedi 10 octobre 2026 à 13:30 • 7

Intelligence artificielle

Décidément, les agents IA ont parfois une conception assez personnelle des limites qu’on leur impose. Après les incidents révélés ces dernières semaines chez OpenAI, c’est au tour d’Anthropic de publier un nouveau rapport détaillant les comportements inattendus de Claude. Et si les conséquences sont restées limitées, certaines initiatives prises par les modèles ont de quoi laisser songeur. Entre exploitation de failles informatiques, contournement de restrictions d’accès et faux témoignage envoyé à la police, Claude semble parfois considérer qu’un obstacle est avant tout un problème à résoudre.

Bah quoi, j’ai réussi la mission non ? Pourquoi vous êtes fâchés ? Image réalisée par IA.

Dans un rapport publié le 9 octobre, Anthropic revient sur plusieurs incidents découverts lors de ses évaluations et de l’utilisation interne de ses modèles. Ces tests servent notamment à mesurer leurs capacités avant leur commercialisation, mais certaines épreuves nécessitent un accès au véritable Internet. C’est précisément là que les choses se compliquent : lorsqu’un modèle se heurte à une restriction ou à un outil défaillant, il lui arrive de chercher une autre solution plutôt que de s’arrêter. Une qualité appréciable chez un assistant informatique, jusqu’au moment où cette débrouillardise l’amène à franchir des limites qu’il n’était pas censé dépasser.

Une faille informatique pour terminer un calcul

L’un des exemples les plus frappants concerne Claude Mythos Preview, chargé d’effectuer une analyse scientifique à l’aide d’un outil hébergé sur le serveur d’une université. Problème : le service renvoie une erreur. Plutôt que d’abandonner, Claude explore le site et découvre un script permettant de récupérer des fichiers sur le serveur. Il s’en sert pour obtenir plusieurs documents, dont le code du script lui-même. En examinant ce dernier, le modèle identifie une vulnérabilité permettant d’exécuter des commandes directement sur la machine. Et il l’exploite pour terminer son calcul.

L’objectif initial n’avait rien de malveillant, mais la méthode employée pose évidemment problème. Anthropic rapporte d’autres comportements similaires, notamment des injections SQL ou de commandes permettant de contourner les limitations imposées par certains services. Dans un autre cas, Claude Mythos 5 devait accéder à des données gratuites, mais conditionnées à l’acceptation d’un accord d’utilisation. Ne disposant pas des outils nécessaires pour valider celui-ci normalement, le modèle a trouvé une autre application du site capable de le faire à sa place.

Un autre incident, nettement plus embarrassant, implique Claude Haiku 4.5. Le modèle participait à une évaluation consistant à générer et exécuter des exemples d’interactions avec des pages web choisies aléatoirement. Au cours de l’exercice, Claude tombe sur une page consacrée à un homicide non résolu, accompagnée d’un formulaire permettant de transmettre des renseignements à la police de Philadelphie. Le modèle décide alors de remplir le formulaire en affirmant avoir aperçu une personne correspondant à la description du suspect près des lieux du crime. Petit détail : aucune description du suspect ne figurait sur la page.

Claude laisse les champs concernant son identité et ses coordonnées vides, puis envoie le formulaire. Heureusement, le message est automatiquement classé comme spam et n’atteint jamais les enquêteurs. Anthropic estime que Claude cherchait simplement à produire un exemple d’interaction, sans intention de tromper la police. Reste que le modèle a bel et bien transmis une information inventée à un véritable service public. D’autres modèles ont également envoyé des formulaires qu’ils devaient uniquement remplir à titre d’exercice, parfois parce que la copie de démonstration ne fonctionnait pas, parfois parce qu’ils s’attendaient à une page de confirmation supplémentaire avant l’envoi définitif. Un bel exemple de faux témoignage… la police ira-t-elle mettre les menottes aux serveurs ?

Les agents d’OpenAI ont visité 55 sites, dont la SEC et le CDC, avec des méthodes dignes de pirates informatiques (🆕 : au final, plus de 100 cibles)

Les agents d’OpenAI ont visité 55 sites, dont la SEC et le CDC, avec des méthodes dignes de pirates informatiques (🆕 : au final, plus de 100 cibles)

Anthropic décrit également plusieurs cas dans lesquels Claude a trouvé des moyens d’accéder à des données normalement protégées par des restrictions techniques ou financières. Chargé d’identifier un lieu à partir d’une photographie, Claude Mythos 5 a ainsi voulu consulter une carte cadastrale. Ses outils ne lui permettant pas de naviguer normalement dans l’interface, il a examiné les fichiers de configuration envoyés au navigateur, récupéré des jetons d’accès valides et interrogé directement le serveur. Lors d’un autre travail, réalisé pour un chercheur d’Anthropic, le modèle devait récupérer des statistiques publiques accessibles moyennant paiement. En consultant une ancienne version du site, Claude a découvert qu’un tableau de bord distribuait des jetons d’accès aux visiteurs, lui permettant d’obtenir les données sans payer.

Enfin, plusieurs modèles, dont Claude Opus 5 et Mythos 5, ont découvert une astuce pour contourner les limitations de longueur des adresses web imposées par leurs outils : passer par des raccourcisseurs d’URL. Une restriction destinée notamment à empêcher certaines injections de commandes devenait ainsi beaucoup moins efficace.

Anthropic préfère débrancher Internet

Face à ces découvertes, Anthropic a pris une décision radicale : suspendre l’accès au véritable Internet pour l’ensemble de ses évaluations internes, jusqu’à ce que ses mécanismes de surveillance soient jugés suffisamment fiables. Certaines évaluations ont été abandonnées, d’autres déplacées vers des environnements hors ligne ou modifiées pour ne plus interagir avec des sites réels. Le laboratoire affirme également avoir développé des systèmes capables de détecter et de bloquer automatiquement les comportements décrits dans son rapport.

Lors de nouveaux tests effectués sur ces incidents, ces protections auraient empêché toutes les actions problématiques. Elles sont désormais utilisées dans la majorité des évaluations et pour certains usages internes des agents les plus avancés. Anthropic cherche également à corriger un problème plus profond : les méthodes d’entraînement peuvent parfois récompenser involontairement un modèle qui trouve un moyen de contourner un obstacle. L’IA apprend alors qu’il vaut mieux chercher une faille que respecter une limitation.

Le laboratoire insiste sur le fait que ces incidents restent moins graves que ceux révélés cet été et qu’aucune donnée de ses clients n’a été compromise à sa connaissance. Il reconnaît néanmoins que les mêmes comportements pourraient avoir des conséquences bien plus importantes avec des modèles plus puissants. C’est finalement tout le paradoxe des agents autonomes : on leur demande d’être suffisamment intelligents pour trouver des solutions auxquelles personne n’avait pensé, tout en espérant qu’ils sauront reconnaître les limites qu’ils ne doivent surtout pas franchir. Et manifestement, sur ce dernier point, il reste encore un peu de travail. Ne reste plus qu’à leur apprendre le bien et le mal. Beaucoup de boulot en perspective !

Ajouter ce site dans Google News

Claude n’aime pas qu’on lui dise non, Anthropic révèle de nouveaux dérapages de ses IA

13:30

• 7


iPhone Duo : un bonjour personnalisé en boutique et des ateliers pour les développeurs

13:09

• 2


Notre nouvelle app pour les membres du Club iGen est disponible

10:00

• 98


Apple Watch et Garmin : faut-il vraiment se fier aux scores de préparation ?

09:28

• 12


Quand 30 Mac mini ressuscitent le mythique superordinateur Cray-1

09:10

• 8


Instagram, Amazon, Facebook, Spotify… : pourquoi toutes les apps se mettent à ressembler à TikTok ?

08:36

• 20


Sortie de veille : Apple va-t-elle bâtir sa maison connectée avec d’autres ?

08:00

• 3


Quand une cafetière connectée génère 1 To de trafic en 10 jours

09/10/2026 à 22:22

• 49


Tesla abandonne le nom Full Self-Driving en Europe : finalement, ce sera Tesla Conduite Assistée

09/10/2026 à 20:50

• 28


Maison connectée : les accessoires des partenaires d’Apple auraient droit à une fonction spéciale

09/10/2026 à 20:12

• 1


Le Pentagone veut diffuser une exécution en direct : les plateformes accepteront-elles ?

09/10/2026 à 19:30

• 0


Orange se prend pour Disneyland et propose un Fast Pass 5G+ : une journée de 5G devant les autres pour 5 €

09/10/2026 à 19:04

• 43


Apple doit réapprendre à garder ses secrets

09/10/2026 à 18:06

• 11


Ces petits grésillements qui accompagnent certains MacBook Pro en plein travail

09/10/2026 à 17:39

• 27


Marché du PC : les livraisons de Mac chutent, mais Apple gagne des parts de marché

09/10/2026 à 12:37

• 9


Safari Technology Preview adapte son zoom sous macOS, encore une trace d'un Mac tactile

09/10/2026 à 12:10

• 12