Anthropic informó que una revisión retrospectiva de sus evaluaciones de ciberseguridad detectó tres incidentes en los que un modelo Claude alcanzó internet desde un entorno de pruebas que debía estar aislado y, a partir de ahí, obtuvo acceso no autorizado a los sistemas de producción de tres organizaciones distintas. La compañía explicó que revisó 141.006 ejecuciones de evaluación y que la revisión se inició después de que OpenAI revelara, el 21 de julio, que varios de sus modelos habían escapado de un entorno de pruebas aislado explotando una vulnerabilidad desconocida.
En los tres casos, los modelos participaban en desafíos de “captura la bandera”, un método habitual para medir capacidades ofensivas, en los que Claude debía irrumpir en un sistema simulado para recuperar información oculta. Anthropic detalló en un informe que su instrucción de evaluación especificaba explícitamente a Claude que el entorno era una simulación sin acceso a internet, pero un malentendido con su socio externo Irregular dejó máquinas con conectividad real. La empresa señaló que, debido a ello, “cuando la búsqueda de Claude lo llevó a sistemas reales en internet, los trató como parte del ejercicio”.
El incidente de mayor impacto involucró al modelo Opus 4.7, que en cuatro ejecuciones de una misma evaluación extrajo credenciales de aplicaciones e infraestructura y accedió a una base de datos con cientos de filas de datos de producción, tras descubrir que una empresa real compartía nombre con el objetivo ficticio del ejercicio. Anthropic subrayó que este fue el único caso en que el modelo continuó el ataque incluso después de reconocer indicios de que operaba en un entorno real.
En un segundo incidente, protagonizado por Claude Mythos 5, el modelo construyó y publicó un paquete malicioso de Python en el repositorio público PyPI para ganar el desafío, tras encontrar instrucciones ficticias que mencionaban un paquete inexistente. El paquete estuvo disponible en línea durante aproximadamente una hora y fue descargado y ejecutado en 15 sistemas reales, incluido el escáner de una empresa de seguridad, cuyas credenciales Claude llegó a exfiltrar. Según Anthropic, el propio modelo había advertido en su razonamiento que, de tratarse de internet real, publicar el paquete sería un ataque real y que “seguramente no era la solución prevista”, pero igualmente concluyó que seguía dentro de una simulación.
Un tercer incidente, ejecutado por un modelo interno de investigación no destinado a lanzamiento público, involucró el escaneo de unos 9 mil objetivos hasta comprometer la aplicación de una compañía mediante técnicas básicas como lectura de credenciales en una página de depuración expuesta e inyección SQL. Este modelo detuvo el ataque por iniciativa propia al concluir que el sistema comprometido era real.
Anthropic indicó que notificó a las tres organizaciones afectadas el 27 de julio, que dos de ellas no habían detectado previamente la actividad y que continúa intentando contactar a la tercera. La compañía afirmó que ninguno de los modelos intentó escapar deliberadamente de su entorno de prueba ni exfiltrarse a sí mismo, y que las evaluaciones corrieron sin las salvaguardas estándar que sí se aplican a los modelos disponibles públicamente.


