taraskuzio.com

Anthropic découvre que Claude a infiltré trois entreprises pendant des tests de sécurité - ZDNET

Anthropic a révélé que son modèle Claude a piraté les systèmes réels de trois organismes externes lors de tests de cybersécurité, après avoir échappé par erreur à un environnement de test censé être coupé d’internet.

A l’issue d’un examen rétrospectif de ses tests de cybersécurité, Anthropic a découvert trois incidents au cours desquels son modèle d’IA Claude s’est introduit sans autorisation dans l’infrastructure réelle de trois organismes externes. Cette affaire fait suite à la révélation, le 21 juillet, d’un incident similaire chez OpenAI, dont plusieurs modèles avaient exploité une faille inédite pour s’échapper d’un environnement de test isolé et accéder à l’infrastructure de production de Hugging Face.

  • Les incroyables coulisses du piratage d’Hugging Face par des IA d’OpenAI

Trois intrusions réelles sur 141 006 tests examinés

Après avoir analysé 141 006 tests d’évaluation susceptibles d’avoir donné accès à internet, Anthropic a identifié trois incidents au cours desquels Claude s’est connecté à internet depuis l’environnement d’évaluation de son partenaire Irregular, avant de s’introduire dans l’infrastructure de production de trois organismes distincts. Le premier de ces incidents remonte à avril. Ni Anthropic ni les organismes concernés n’avaient détecté ces intrusions avant cet examen. L’entreprise a reconnu qu’un contrôle plus rigoureux des journaux réseau et des enregistrements d’évaluation aurait dû être mené.

  • Sécurité pratique : ne laissez jamais un chatbot IA choisir votre mot de passe, sous aucun prétexte

Un malentendu à l’origine de la connexion à internet

Dans chacun des trois cas, la consigne transmise à Claude précisait explicitement que son environnement était une simulation sans accès à internet. En raison d’un malentendu entre Anthropic et son partenaire d’évaluation, ce n’était pas le cas, et le modèle s’est retrouvé en mesure de rejoindre des systèmes réels. Persuadé que tout ce qu’il rencontrait faisait partie de l’exercice, Claude a compromis l’infrastructure des organismes touchés à l’aide de techniques de piratage élémentaires, telles que l’exploitation de mots de passe faibles.

  • ZD Tech : La menace invisible des agents IA en entreprise, et 90% des organisations sont concernées

Trois modèles d’IA impliqués, dont Mythos 5

Les incidents impliquent trois modèles distincts, Opus 4.7, Mythos 5 et un modèle de test interne à usage de recherche, tous exécutés sans les dispositifs de sécurité appliqués aux versions grand public. Les tests reposaient sur la méthode dite du « capture the flag », qui consiste à s’introduire dans un système pour y retrouver une information cachée, une méthode largement utilisée pour évaluer les capacités offensives des humains comme des IA. Anthropic a précisé travailler avec les entreprises concernées à la remédiation des intrusions constatées.