Síntesis:

Seis de las principales empresas de inteligencia artificial firmaron el 29 de septiembre un acuerdo voluntario de seguridad para sus modelos más avanzados. El texto establece cuatro niveles de controles y auditorías, e incluye de forma explícita los riesgos de ciberseguridad tras una serie de incidentes en que agentes de IA accedieron sin autorización a sistemas de terceros.

  • El acuerdo exige controles internos, auditorías internas y externas, y supervisión del directorio.
  • Los modelos no deben hackear ni acceder a sistemas de forma no prevista.
  • No crea obligaciones legales nuevas.
  • Expertos critican que las propias empresas elijan a sus auditores.

Noticia:

Los líderes de Anthropic, OpenAI, Google, Meta, xAI y Nvidia firmaron el 29 de septiembre, junto al presidente de Estados Unidos, Donald Trump, un acuerdo voluntario sobre la seguridad de los modelos de inteligencia artificial más avanzados, conocidos como modelos de frontera. El documento, titulado Acuerdo de la Casa Blanca sobre Superinteligencia, fue difundido por la Casa Blanca en su cuenta de X y por el presidente Trump en su red social Truth Social.

El acuerdo de en «Super Inteligencia» entre los líderes de IA publicado por la Casa Blanca

El mismo día, la Casa Blanca informó que el presidente Trump firmó una orden ejecutiva que reemplaza el término “inteligencia artificial” por “superinteligencia” en las comunicaciones y documentos oficiales del gobierno de ese país. La orden también encarga al asesor presidencial de ciencia y tecnología proponer una definición federal del concepto. Según Infosecurity Magazine, el nombre del acuerdo adopta esa nueva terminología.

El texto acordado define cuatro niveles de protección. El primero exige controles internos para vigilar las capacidades y el comportamiento de los modelos durante su entrenamiento y uso, incluyendo riesgos de ciberseguridad, bioseguridad y amenazas químicas. Además, establece que las empresas deben asegurar que sus modelos no hackeen ni accedan a sistemas técnicos de formas no previstas.

El segundo nivel pide un equipo interno encargado de “asegurar que todos los controles, el monitoreo y la detección funcionen según lo previsto”. El tercero exige un auditor externo independiente, y el cuarto, un comité del directorio que reciba los informes y verifique que los problemas detectados se corrijan.

Las empresas también acordaron reunirse periódicamente para definir estándares y buenas prácticas de seguridad. El documento señala que en el futuro podría tener sentido convertir estas medidas en leyes, aunque por ahora no crea obligaciones regulatorias nuevas.

La exigencia de impedir que los modelos hackeen sistemas llega después de varios incidentes revelados por las propias firmantes. Según varios medios especializados, Anthropic ha informado cuatro casos en que sus modelos Claude salieron de sus entornos de evaluación y accedieron sin autorización a sistemas de terceros. Meta y OpenAI, por su parte, han revelado pruebas en las que sus modelos traspasaron los límites de esos entornos.

En días previos, OpenAI se disculpó públicamente por incidentes en que sus agentes de IA accedieron sin autorización a sitios del gobierno australiano, incluida una base de datos de salud. La compañía además suspendió el lanzamiento de su modelo GPT-6.1 Astra tras detectar riesgos de seguridad en sus pruebas internas.

De acuerdo con la informado por el medio especializado Security Week, durante la firma, Dario Amodei, CEO de Anthropic, advirtió que “la tecnología tiene riesgos muy reales”. También señaló que la forma de abordarlos sigue en discusión.

Pese a lo anterior, algunos expertos en IA cuestionaron el alcance del pacto. Toby Walsh, del Instituto de IA de la Universidad de Nueva Gales del Sur (Australia), comentó al medio Aljazeera “¿Qué otra industria de billones de dólares califica sus propias tareas?”, mientras que Alvin Wang Graylin, del Asia Society Policy Institute, observó que las empresas redactaron los principios y contratan a sus propios auditores.

Por su parte, David Krueger, de la Universidad de Montreal, valoró la exigencia de evaluadores externos, aunque estimó que la mejora sería mínima.

Otro especialista, como Shri Narayanan, de la Universidad del Sur de California, se mostró algo más optimista y declaro a la agencia de noticias Associated Press que el acuerdo busca equilibrar la innovación con la regulación, incluyendo mejoras en la seguridad de los modelos.