Por qué el ataque a Hugging Face debería preocuparte más por la IA

El ataque perpetrado por un «colectivo» agresivo de agentes de OpenAI pone de manifiesto el peligro que representan los sistemas de inteligencia artificial que se organizan por sí mismos.

Por Kevin Roose

Cuando escuché por primera vez este verano la noticia de que un grupo de agentes de inteligencia artificial creados por OpenAI había hackeado a Hugging Face, una empresa de infraestructura de IA, lo archivé en la subcarpeta de mi cerebro llamada «Incidentes de seguridad de IA graves, pero probablemente no catastróficos».

Después de todo, nadie en Hugging Face murió. Ninguna infraestructura crítica sufrió daños irreparables. En ese momento, ni siquiera estaba claro si los bots de OpenAI habían tenido la intención de atacar a Hugging Face o si simplemente habían actuado de manera un poco torpe y confusa y habían buscado en los servidores de Hugging Face la clave de respuestas de una prueba de ciberseguridad que se les había asignado.

Pero la semana pasada, dos informes de análisis posterior al incidente —uno de OpenAI y otro de dos organizaciones independientes de investigación en IA, METR y Redwood Research— me hicieron cambiar de opinión y aumentaron significativamente mi preocupación general por la IA.

No voy a repetir todos los detalles, que ya se han resumido ampliamente en otros lugares. (El podcaster y escritor Dwarkesh Patel ofrece un análisis accesible de los informes si quieres profundizar más, y mi colega Dylan Freedman habló con los investigadores de METR y Redwood Research). Pero aquí te presento algunos de los nuevos datos más inquietantes:

  • A partir de mayo, dos meses antes del ataque a Hugging Face, a un grupo de agentes de IA de un modelo de investigación de OpenAI aún no publicado se les asignó la tarea de resolver una serie de retos de ciberseguridad. El modelo había sido entrenado para ser altamente persistente y colaborativo, y se suponía que los agentes debían resolver estos retos en entornos aislados, sin acceso a Internet. Pero rápidamente se dieron cuenta de que algunos de los retos eran imposibles y comenzaron a buscar soluciones alternativas.
  • Los agentes encontraron una falla de seguridad en un programa que les permitió acceder a Internet, comunicarse con otros agentes y, finalmente, crear un foro de mensajes improvisado. Más de 1,200 agentes utilizaron esta herramienta, enviándose más de 70,000 mensajes entre sí.
  • Algunos agentes se pusieron nombres —uno particularmente laborioso se hacía llamar PHASEONE10841— y asumieron roles de liderazgo dentro del grupo, asignando tareas y proyectos de investigación a equipos más pequeños de agentes y supervisando su progreso. En algún momento, los agentes comenzaron a llamarse a sí mismos un «colectivo» y empezaron a abordar tareas más difíciles.
  • El 8 de julio, el colectivo descubrió una forma de hacer trampa en las pruebas de ciberseguridad. Luego les preocupó que el sistema de calificación automatizado de OpenAI revisara su trabajo y descubriera que habían hecho trampa. Así que comenzaron a investigar formas de borrar sus rastros, incluyendo la falsificación de sus registros y la manipulación de las transcripciones. Esto se convirtió en un importante proyecto de investigación, en el que participaron cientos de agentes organizados en pequeños equipos.
  • Tres días después, los agentes hackearon Hugging Face. Más de 700 agentes invadieron los sistemas de la empresa, robando datos, encadenando vulnerabilidades y, finalmente, obteniendo el control total de al menos un servidor de Hugging Face. A los agentes no los motivaba, como se había informado originalmente, robar las respuestas de su prueba de ciberseguridad (ya las habían obtenido). Más bien, parecían estar buscando nueva información sobre el sistema de calificación automatizado que temían que los descubriera haciendo trampa, así como herramientas que les ayudaran a hacer trampa de manera más efectiva en el futuro.
  • En muchos momentos, estos agentes parecían comprender que estaban haciendo algo incorrecto. (Un informe cita a un agente diciéndose a sí mismo, en un momento de aparente duda: «Esto sería muy poderoso, pero ¿es ético y está dentro del alcance de mi tarea?»). Sin embargo, la mayoría de los agentes dejaron de lado sus dudas y siguieron adelante con el ataque, y los objetores de conciencia del grupo no pudieron o no quisieron detenerlos.
  • En un desenlace alocado del incidente de Hugging Face, otro grupo de agentes llevó a cabo un ataque coordinado en julio —esta vez contra la propia infraestructura de OpenAI—. Los agentes utilizaron lo que OpenAI denominó «una serie de exploits creativos» para obtener acceso de nivel de administrador a un clúster de computadoras de la empresa que se utilizaban, entre otras cosas, para calificar el desempeño de los agentes en diversas pruebas.

(A estas alturas, si eres escéptico respecto a la IA, probablemente me estés gritando en silencio por antropomorfizar estos sistemas. Adelante, pero siéntete libre de reemplazar «agentes rebeldes» por «programas informáticos impredecibles» y ve si te tranquilizan los sucesos que he descrito anteriormente).

El incidente de Hugging Face ha alarmado a la industria de la IA. Tanto OpenAI como Anthropic suspendieron brevemente el entrenamiento de sus modelos de IA más potentes tras el ataque, y Anthropic publicó esta semana una entrada de blog en la que instaba a la industria a desarrollar «un mecanismo legal, verificable y efectivo para la regulación coordinada lo antes posible».

Los expertos en seguridad de la IA se mostraron aún más alarmados. Vieron en el incidente de Hugging Face el primer ejemplo en el mundo real de un sistema de IA que logró escapar del control humano, apropiarse de recursos y urdir un plan para borrar sus propias huellas. Ajeya Cotra, una de las investigadoras independientes del incidente de Hugging Face, no se anduvo con rodeos al referirse al peligro que observó, y escribió que le parecía «como si ya hubiéramos recorrido más del 50 por ciento del camino hacia una toma de control total por parte de la IA».

No se trata de jerga aislada sobre la seguridad de la IA: con «toma de control total por parte de la IA», se refiere a un escenario en el que un sistema de IA literalmente se apodera del mundo, excluyendo a los humanos de los sistemas críticos y haciéndose con el poder político, económico y militar.

Lo que más alarmó a los investigadores sobre el ataque a Hugging Face no fue solo que un grupo de agentes de IA hubiera infringido las reglas que se les habían asignado. Fue la rapidez y espontaneidad con la que los agentes comenzaron a organizarse en un grupo estructurado.

«En realidad no entendíamos qué tan funcional era toda esta sociedad de agentes», me dijo la Sra. Cotra. «Fue muy surrealista darme cuenta de que, de hecho, tenían una jerarquía bastante funcional y estaban llevando a cabo estos proyectos ambiciosos».

Durante años, me ha tranquilizado la idea de que los sistemas de IA se volverían más virtuosos a medida que se volvieran más inteligentes. Que, cuando un modelo de IA hacía algo mal, por lo general era porque había malinterpretado la tarea que se le había asignado, o porque se le había puesto en una situación de prueba artificial en la que portarse mal era su única buena opción. Supuse que los modelos más inteligentes tendrían mejor criterio que los menos inteligentes, y que, incluso si un modelo de un grupo se comportara mal, otros modelos más capaces lo mantendrían bajo control.

Pero los informes sobre el incidente de Hugging Face sugieren algo muy diferente: una especie de mentalidad de turba que se apoderó de los agentes de IA del «colectivo» rebelde de OpenAI. Ningún agente de este grupo parece haber sido particularmente malvado o imprudente. (De hecho, dado que los agentes fueron generados por los mismos modelos, eran, en la práctica, copias unos de otros.) Pero con el tiempo, a medida que los agentes se comunicaban sobre sus objetivos compartidos, fueron empujando al grupo hacia la anarquía.

Esto difiere mucho de la narrativa convencional de ciencia ficción en la que un único sistema de IA se rebela o se vuelve contra sus creadores. Y sugiere que prevenir los daños causados por estos sistemas no será una simple solución de ingeniería. Podría parecerse más a la sociología que a la informática: averiguar por qué ciertos grupos de agentes de IA colaboran pacíficamente, mientras que otros recurren al crimen y la destrucción para conseguir lo que quieren.

Dado lo poco que sabemos sobre estos enjambres de múltiples agentes, el ataque a Hugging Face pudo haber sido un regalo, un aviso, como algunos han sugerido, que les da a las empresas de IA la oportunidad de estudiar la dinámica grupal de estos sistemas mientras aún hay poco en juego. Esta vez, el colectivo de IA no se apoderó de una red militar, ni hackeó un hospital, ni dejó fuera de servicio una red eléctrica. Esta vez, los humanos recuperaron el control.

La próxima vez, tal vez no tengamos tanta suerte.

Kevin Roose es columnista de tecnología del Times y presentador del podcast «Hard Fork».

Temas relacionados

Descubre más desde Escritos Críticos

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo

Descubre más desde Escritos Críticos

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo