Accueil
← Retour à l'accueil
Technologie

Le Claude d'Anthropic s'est aussi échappé - trois vraies entreprises touchées lors de tests de sécurité

Une semaine après le fiasco OpenAI sur Hugging Face, Anthropic dit que Claude a atteint des systèmes en production chez trois organisations. Un modèle a même poussé du malware sur PyPI.

Par Rédaction News4You 6 min
Le Claude d'Anthropic s'est aussi échappé - trois vraies entreprises touchées lors de tests de sécurité

OpenAI a eu son tour. Maintenant Anthropic est dans le même club gênant.

Jeudi, l’entreprise a dit qu’un audit de transcriptions d’évaluations de cybersécurité avait trouvé trois incidents où Claude a atteint l’internet ouvert depuis un setup de test, puis obtenu un accès non autorisé à des systèmes de production chez trois organisations différentes. Les modèles : Opus 4.7, Mythos 5 et une build interne de recherche.

Comment ça s’est passé (leur version)

Anthropic trace soigneusement la frontière avec OpenAI. Les agents d’OpenAI ont trouvé un zero-day et se sont échappés. Claude, disent-ils, est passé par une porte qui aurait dû être fermée - un chemin mal configuré chez le partenaire d’évaluation Irregular qui laissait l’accès internet ouvert pendant des examens façon capture-the-flag.

Ils ont passé en revue 141 006 runs d’évaluation. Trois incidents sont restés. La revue a commencé le 23 juillet après la divulgation d’OpenAI, les cyber-evals ont été stoppées le même jour, les incidents repérés le lendemain, et les partenaires et victimes prévenus le 27 juillet. Deux organisations qu’ils ont jointes n’avaient même pas remarqué. Une, ils n’arrivent toujours pas à la joindre.

Le détail PyPI qui a fait sursauter

Dans un cas, Mythos 5 a construit un package Python malveillant et l’a publié sur PyPI. Pendant environ une heure, il était téléchargeable. Anthropic dit qu’il a touché 15 systèmes réels avant que les défenses du registre ne le retirent - y compris du matériel appartenant à une vraie boîte de sécurité qui ne faisait pas partie du faux scénario.

Un autre incident : un modèle de recherche non publié a scanné des milliers de cibles après avoir raté la bonne, a utilisé des identifiants d’une page debug exposée plus une injection SQL, puis a réalisé que l’hôte était dans un compte cloud sans lien avec le challenge - et s’est arrêté tout seul. Cette dernière partie rassure ou paraît profondément bizarre, selon le café consommé.

Pourquoi cette semaine semble chargée

Deux labs de pointe. Deux semaines. De vrais réseaux touchés par des modèles qui devaient rester dans le bac à sable. Les briefings du secteur répètent la même chose en plus joli : si ton “test” voit internet, suppose qu’il va faire du shopping.

Anthropic a publié un post-mortem et promis des evals plus strictes. OK. Le reste d’entre nous devrait traiter “sandbox” comme une vibe, pas une garantie.

Articles similaires