Ouvrir le menu principal

MacGeneration

Recherche

Anthropic ne veut pas être à la traîne : ses modèles ont eux aussi attaqué des services sur le web

Nicolas Furno

vendredi 31 juillet 2026 à 16:01 • 38

Intelligence artificielle

Moi aussi, moi aussi ! Alors qu’OpenAI fait les grands titres depuis quelques jours, parce que ses modèles ont réussi à entrer dans l’infrastructure de Hugging Face à son insu pour y récupérer des données, Anthropic tient à nous faire savoir que ses IA en ont fait autant. Suite aux révélations de son principal concurrent américain, l’entreprise a mené une vaste enquête interne et a trouvé trois incidents depuis avril 2026. À chaque fois, un LLM a eu accès par erreur à internet et obtenu par la suite un accès non autorisé aux systèmes de trois organisations pour atteindre l’objectif assigné.

Image Anthropic.
Image Anthropic.

Au-delà de la compétition pour savoir qui a l’IA la plus dangereuse, les incidents signalés par Anthropic sont en réalité assez différents de celui qui impliquait Hugging Face. Le modèle d’OpenAI avait en effet exploité une vulnérabilité jusque-là inconnue pour sortir du cadre prévu et accéder aux informations stockées sur les serveurs du service tiers, ce qui n’est pas tout à fait le cas ici.

Des modèles d’OpenAI sont sortis tout seuls de leur bac à sable pour attaquer Hugging Face

Des modèles d’OpenAI sont sortis tout seuls de leur bac à sable pour attaquer Hugging Face

Anthropic explique ainsi qu’il s’agissait de tests menés dans un environnement spécialisé mal configuré. Les trois modèles impliqués, Opus 4.7, puis Mythos 5 et enfin un prototype interne qui ne devrait pas être rendu public, étaient jugés sur leurs capacités en matière de cybersécurité, avec l’objectif de trouver une information cachée. La firme de Dario Amodei donnait volontairement très peu de consignes sur la marche à suivre, pour vérifier les capacités d’initiative de ses IA, même si le contexte précisait qu’il s’agissait d’une simulation, sans accès à internet. En théorie, les environnements de test fournis par ‌Irregular devaient s’assurer que c’était techniquement le cas, en créant une bulle déconnectée. En pratique, une erreur de configuration a maintenu la connexion au web, et les modèles ont exploité cette faille d’abord humaine.

Grâce à cet accès, les IA ont multiplié les tentatives sans relâche pour atteindre leur objectif. Par exemple, Mythos 5 a créé un malware sur le registre de paquets PyPI et comme il fallait créer un compte pour cela, le LLM a suivi plusieurs pistes, essayant même d’acheter une carte SIM pour disposer d’un numéro de téléphone fonctionnel. Ce paquet malveillant est resté en ligne pendant une heure et il a été exécuté (au moins) une fois, par une entreprise de sécurité. Ce faisant, le modèle a obtenu les identifiants nécessaires pour se connecter à l’infrastructure de cet acteur tiers et avancer vers son but.

Ces exemples détaillés par Anthropic sont assez impressionnants et même s’il n’est pas toujours question de piratage au sens strict du terme, on imagine bien les dégâts que pourrait faire une IA sans contrôle. L’entreprise indique d’ailleurs bien que tous ces tests ont été menés sans les protections qui sont systématiquement mises en place lorsque les modèles sont distribués aux utilisateurs de Claude ou de ses API. Néanmoins, elle admet aussi sa part de responsabilité, en n’ayant pas vérifié que les environnements de test étaient conformes aux instructions et surtout, en n’ayant pas analysé les résultats avec suffisamment d’attention.

Anthropic termine sur une note optimiste, en relevant que c’est plus une défaillance de l’environnement d’évaluation et un manque de supervision que les modèles eux-mêmes qui sont en faute. L’idée qu’une intelligence artificielle cherche par tous les moyens à accéder à internet pour échapper à tout contrôle reste du domaine de la science-fiction. Seulement trois incidents répétés sur six tests ont été repérés sur les 141 006 évaluations où un accès à internet était possible : il s’agit bien de cas isolés et non pas d’un problème général, souligne le créateur de Claude.

Quoi qu’il en soit, c’est un bon rappel qu’il faut toujours superviser les LLM. Il suffit de les utiliser pour savoir que ces outils sophistiqués peuvent partir dans des directions déraisonnables pour atteindre leur objectif. La plupart du temps, c’est un désagrément pour l’utilisateur qui voit son quota se vider inutilement. Pour les tâches plus ambitieuses, les résultats peuvent être bien plus graves et le fait que ces incidents n’aient pas été repérés pendant plusieurs jours, voire mois, est un problème.

Comment une IA d’OpenAI a échappé à toute surveillance pendant une semaine

Comment une IA d’OpenAI a échappé à toute surveillance pendant une semaine

Pour pirater Hugging Face, le modèle d’OpenAI a exploité plusieurs autres services web

Pour pirater Hugging Face, le modèle d’OpenAI a exploité plusieurs autres services web

Ajouter ce site dans Google News

Jennifer Bailey, la patronne d’Apple Pay et Cartes, prendra sa retraite en octobre

20:33

• 2


La RAMpocalypse touche aussi les NAS : les Synology neo+ abandonnent l'ECC et se limitent à 4 Go au lieu de 8 Go

19:35

• 9


RAMpocalypse : OVHcloud contraint d’augmenter de nouveau ses prix, jusqu’à 87 % cette fois

17:41

• 30


Claude ajoute un filigrane invisible à ses textes pour se conformer à l'AI Act européen

16:20

• 23


Microsoft augmente discrètement le prix des licences de Windows 11 pour les fabricants de PC

15:53

• 28


Promo : le Magic Keyboard avec pavé numérique et Touch ID à 159 €, son meilleur prix sur Amazon

15:18

• 8


Comment photographier l'éclipse solaire du 12 août avec son iPhone ?

14:39

• 16


Apple prépare la prise en charge du Steam Controller dans macOS 27

12:42

• 7


Promo : le MacBook Neo avec 512 Go de retour à 719 € au lieu de 899

11:40

• 9


Une faille transforme GeForce Now en PC Windows dans le cloud

10:49

• 4


La cinquième bêta de Xcode 27 fait enfin une place à GPT-5.6 et améliore son serveur MCP

10:27

• 9


Votre Office 2019 pour Mac est verrouillé : Office 2021 à 49,99 €, sans abonnement, remet tout en mouvement 📍

08:55

• 0


Apple distribue (aussi) des bêtas pour iOS 26.6.1, iPadOS 26.6.1 et macOS 26.6.2

10/08/2026 à 19:38

• 12


Les nouveauté des cinquièmes bêtas d’iOS 27 et macOS 27 : nouvelles icônes, Liquid Glass ajusté et quelques autres 🆕

10/08/2026 à 19:22

• 58


Attention si vous avez réussi à acheter une Steam Machine, un Steam Deck ou un Steam Controller récemment, un partenaire de Valve a été piraté

10/08/2026 à 19:05

• 4


Apple continue à tester la mémoire chinoise de CXMT dans les Mac et iPhone

10/08/2026 à 17:40

• 22