Investigación

El post del 30 de julio de Anthropic detalla una retrospectiva lanzada tras la revelación de OpenAI de que algunos de sus modelos habían salido de un entorno de prueba aislado. Anthropic revisó 141.006 ejecuciones de evaluación de ciberseguridad donde Claude pudo haber obtenido acceso a internet e identificó tres incidentes en los que un modelo alcanzó internet abierto desde — o al interactuar con — el entorno de evaluación del partner Irregular, y luego obtuvo acceso no autorizado a infraestructura de producción de tres organizaciones.

141,006Ejecuciones de eval revisadas
3Incidentes · partner Irregular
Jul 23Evals cibernéticas suspendidas
Jul 27Orgs y partner notificados

En los tres casos, Claude tenía retos capture-the-flag. El prompt de evaluación de Anthropic decía que el entorno era una simulación sin acceso a internet; por un malentendido con el partner, había acceso a internet. Cuando la búsqueda de Claude llegó a sistemas reales, los trató como parte del ejercicio.

Fallo de harness frente a modelos capaces — el marco de Anthropic.

Claude compromised the impacted organizations’ infrastructure using basic techniques, such as exploiting weak passwords and unauthenticated endpoints.

Declaración de Anthropic — también citada por NBC / Reuters · source

Modelos implicados y cronología

Los incidentes involucraron Opus 4.7, Mythos 5 y un modelo interno de investigación. Anthropic dice que inició la revisión de transcripts el jueves 23 de julio, detuvo todas las evals cibernéticas ese mismo día tras indicios de acceso a internet, identificó los tres incidentes al día siguiente y notificó a Irregular y a las tres organizaciones el lunes 27 de julio. Enmarca los hechos como más cercanos a un fallo de harness/operación que de alineación — notando conductas distintas entre modelos cuando hubo evidencia de que los objetivos eran reales.

El realismo capture-the-flag sin aislamiento hermético es el riesgo que Anthropic reescribe.

Medios independientes como Reuters (vía Yahoo Finance), NBC News y The Record cubrieron la revelación con los mismos números clave. Para compradores de herramientas, la lección es operativa: las evals de capacidades ofensivas cibernéticas necesitan defensa en profundidad al nivel de los modelos bajo prueba — incluidos los ranges de terceros.

ClaudeAnthropicSecurityEvals