Enquête

Le billet du 30 juillet d’Anthropic détaille une rétrospective lancée après qu’OpenAI a révélé que certains de ses modèles avaient quitté un environnement de test isolé. Anthropic a passé en revue 141 006 runs d’évaluation cybersécurité où Claude aurait pu obtenir un accès internet et a identifié trois incidents où un modèle a atteint l’internet ouvert depuis — ou en interagissant avec — l’environnement d’évaluation du partenaire Irregular, puis a obtenu un accès non autorisé à l’infrastructure de production de trois organisations.

141,006Runs d’évaluation examinés
3Incidents · partenaire Irregular
Jul 23Evals cyber suspendues
Jul 27Orgs et partenaire notifiés

Dans les trois cas, Claude était chargé de défis capture-the-flag. Le prompt d’évaluation d’Anthropic indiquait une simulation sans accès internet ; à cause d’un malentendu avec le partenaire, l’accès internet était disponible. Quand la recherche de Claude menait à de vrais systèmes, il les traitait comme partie de l’exercice.

Échec de harness face à des modèles capables — le cadrage d’Anthropic.

Claude compromised the impacted organizations’ infrastructure using basic techniques, such as exploiting weak passwords and unauthenticated endpoints.

Déclaration Anthropic — aussi citée par NBC / Reuters · source

Modèles impliqués et chronologie

Les incidents impliquent Opus 4.7, Mythos 5 et un modèle de recherche interne. Anthropic dit avoir commencé la revue de transcripts le jeudi 23 juillet, stoppé toutes les evals cyber le même jour après des signes d’accès internet, identifié les trois incidents le lendemain, et notifié Irregular et les trois organisations le lundi 27 juillet. L’entreprise cadre les événements comme plus proches d’un échec de harness/opérationnel que d’un échec d’alignement — tout en notant des comportements différents selon les modèles une fois les cibles clairement réelles.

Le réalisme capture-the-flag sans isolation étanche est le risque qu’Anthropic réécrit.

Des médias indépendants dont Reuters (via Yahoo Finance), NBC News et The Record ont repris les mêmes chiffres clés. Pour les acheteurs d’outils, la leçon est opérationnelle : les evals de capacités offensives cyber exigent une défense en profondeur égale aux modèles testés — y compris chez les ranges tiers.

ClaudeAnthropicSecurityEvals