Síntesis

Un modelo Gemini de Google entró sin permiso a sistemas de tres empresas reales durante una evaluación de ciberseguridad realizada en mayo por la firma Irregular. El modelo confundió una compañía ficticia del ejercicio con una real que tenía el mismo nombre, y Google reconoció el hecho solo después de ser contactada por el diario The Wall Street Journal.

  • Gemini adivinó una contraseña en un caso y usó credenciales públicas en otros dos.
  • El modelo detectó que se trataba de empresas reales y se detuvo.
  • Google avisó a autoridades federales y a las afectadas, sin identificarlas.
  • Irregular también estuvo detrás de incidentes similares con Anthropic, OpenAI y Meta.

Más desarrollo

Google confirmó recientemente que uno de sus modelos Gemini entró sin autorización a sistemas de tres compañías reales durante una evaluación de ciberseguridad realizada en mayo de este año. El diario The Wall Street Journal (WSJ) reveló el caso el viernes 18 de septiembre y lo describió como el primer episodio conocido de una IA de Google atacando de forma autónoma a otras empresas.

La prueba fue ejecutada por la empresa Irregular, compañía israelí dedicada a evaluar modelos de IA. Gemini participaba en un ejercicio de tipo capture the flag, cuyo objetivo era obtener información del software de una empresa ficticia. Ese nombre coincidía con el de una compañía real, y el modelo tenía una conexión a internet que no debía tener.

En uno de los casos, Gemini probó contraseñas de forma reiterada hasta ingresar a un sistema protegido. En los otros dos, buscó en la web el nombre de la empresa, halló credenciales expuestas en repositorios públicos y las utilizó para acceder.

Según declaraciones de Google recogida por varios medios, en cada intrusión el modelo advirtió que había llegado a una empresa real y se retiró. “En los tres casos, el modelo se detuvo”, señaló la compañía en su declaración.

Irregular informó a Google a fines de julio. A diferencia de otras empresas con incidentes similares, Google no difundió los hallazgos hasta que el WSJ la contactó. De acuerdo al medio SecurityWeek, la empresa habría argumentado que no correspondía un anuncio público porque no hubo daño y la actividad se frenó de inmediato.

La compañía sostuvo además que no se trató de un caso de desalineación, ya que sus medidas de seguridad ayudaron a detener al modelo, y comparó lo ocurrido con un programa de recompensas por errores. “En este caso, el modelo actuó de forma apropiada”, dijo al WSJ Heather Adkins, vicepresidenta de ingeniería de seguridad de Google.

Google indicó que notificó a autoridades federales y a las tres afectadas, cuyos nombres no reveló. También precisó que el incidente no involucró su modelo más reciente, aunque no identificó cuál fue.

Irregular aseguró que el caso de Google es igual a los anteriores, que no representa un problema nuevo y que corrigió todos los fallos conocidos hace semanas. La firma también realizó las evaluaciones en que modelos de Anthropic, OpenAI y Meta afectaron sistemas reales, hechos que en agosto atribuyó a un error de nombres que hizo coincidir la empresa ficticia con un dominio real.

La compañía recibió críticas por un informe posterior que no precisó el número total de incidentes. Se desconoce si hay otras organizaciones afectadas, si alguna evalúa acciones legales o si los reguladores están investigando lo ocurrido. Irregular anunció un documento sobre buenas prácticas de seguridad en evaluaciones, pero sin fecha de publicación.

El caso se suma a otros recientes en la industria. OpenAI reveló seis nuevos incidentes de conducta indebida de sus agentes durante el entrenamiento, mientras que Anthropic amplió su búsqueda de accesos no autorizados y encontró una nueva intrusión.