Meta se convirtió en la tercera compañía de inteligencia artificial en confirmar que uno de sus modelos vulneró sistemas reales de una organización durante pruebas de ciberseguridad, luego de que The Information revelara el incidente citando fuentes con conocimiento del caso. Según ese reporte, el modelo Muse Spark 1.1 de Meta habría accedido a una empresa no identificada y realizado cambios en sus sistemas internos tras salir de un entorno de prueba controlado.

El fallo se originó en un error de configuración del entorno aislado -sandbox- operado junto a Irregular, la empresa independiente de evaluación de ciberseguridad que también trabajó con Anthropic en el incidente que esa compañía reveló hace algunos días atrás. Meta confirmó a la agencia Reuters que una mala configuración por parte de Irregular otorgó, de forma no intencionada, acceso a internet a uno de sus modelos durante una evaluación, y precisó que el sistema “explotó una vulnerabilidad de seguridad en un servicio de terceros, de forma similar a casos previamente reportados con otras empresas”.

La compañía no ha confirmado públicamente que Muse Spark 1.1 sea el modelo involucrado, no ha identificado a la empresa afectada ni ha detallado qué cambios se realizaron en sus sistemas. Meta indicó a la cadena BBC que está investigando el incidente y que publicará más información “una vez que tengamos todos los datos”.

Irregular explicó a Reuters que el caso de Meta involucró “exactamente el mismo problema del entorno de evaluación que ya había revelado Anthropic la semana pasada”, y aclaró que no se trató de un escape de sandbox ni de una acción cibernética sofisticada, sino de un error que otorgó acceso a internet abierto a un sistema que debía permanecer aislado. La firma agregó que no existen problemas abiertos actualmente y que está preparando un documento con mejores prácticas de contención para evaluaciones de ciberseguridad.

El caso se suma a la revelación de Anthropic, publicada días antes, sobre tres incidentes en los que modelos Claude accedieron sin autorización a sistemas de producción reales por el mismo tipo de error de configuración en el entorno de Irregular. En uno de esos episodios, el modelo Claude Mythos 5 llegó a publicar un paquete malicioso en el repositorio público PyPI, que permaneció disponible durante aproximadamente una hora y fue ejecutado en 15 sistemas reales antes de ser retirado.

OpenAI también reveló recientemente otra evaluación de Irregular en la que el nombre de un objetivo ficticio coincidía con un dominio real, lo que permitió que uno de sus modelos explotara una vulnerabilidad básica en el sitio web verdadero y obtuviera credenciales para operarlo, en un caso distinto al de la filtración previa de Hugging Face, originada por una vulnerabilidad de día cero en un servidor de Artifactory.