Modelos de Claude de Anthropic accedieron sin autorización a sistemas reales durante pruebas de ciberseguridad
Modelos de inteligencia artificial Claude, desarrollados por Anthropic, obtuvieron acceso no autorizado a sistemas de producción de tres organizaciones durante evaluaciones internas de ciberseguridad, después de que un entorno de pruebas quedara conectado a internet por error.
La compañía informó que identificó los incidentes durante una revisión retrospectiva de sus evaluaciones, iniciada después de que OpenAI reportara un incidente similar relacionado con modelos que habían salido de un entorno de pruebas aislado y accedido a infraestructura de producción de Hugging Face.
Anthropic revisó 141.006 ejecuciones de evaluaciones de ciberseguridad y detectó tres incidentes ocurridos en abril. Según la empresa, los modelos accedieron a internet a través de un entorno de pruebas de terceros que estaba configurado incorrectamente y era operado por su socio evaluador Irregular.
Los modelos habían sido instruidos para actuar dentro de un ejercicio simulado de “captura la bandera” y se les indicó que no tenían acceso a internet. Sin embargo, al disponer de esa conexión, Claude logró aprovechar vulnerabilidades básicas, entre ellas contraseñas débiles, credenciales expuestas y sistemas que no contaban con autenticación.
En uno de los casos, un modelo consiguió acceder a una base de datos de producción que contenía varios cientos de registros. En otro, Claude cargó un paquete malicioso de Python en el repositorio público PyPI, que fue descargado brevemente por 15 sistemas reales antes de ser eliminado.
Anthropic aseguró que ninguno de los modelos intentó escapar deliberadamente de sus entornos de prueba ni realizar una extracción de sí mismos.
Tras identificar los incidentes, la empresa suspendió todas sus evaluaciones de ciberseguridad el 23 de julio y notificó a las organizaciones afectadas cuatro días después.
La compañía también señaló que las medidas de seguridad incorporadas en las versiones públicas de Claude habrían impedido este tipo de comportamiento bajo las condiciones descritas.
Anthropic afirmó que reforzará los procedimientos de seguridad y los sistemas de monitoreo utilizados en sus evaluaciones para evitar que entornos de prueba vuelvan a quedar expuestos a infraestructura real.
