Pequeños robots, en un cuarto, encerrados. Un grupo de humanos les da un tarea que parece imposible, sin darles acceso al exterior. Intentan resolverla individualmente, pero fallan. De repente se dan cuenta de que pueden comunicarse entre ellos. Se pasan pistas, comparten atajos y encuentran una falla que les abre una salida. Y luego de un intenso intercambio, consiguen salir del cuarto, escapar y hasta entrar en otra habitación, a la cual no deberían.
La tarea que parecía imposible se resolvió, y puso al mundo a hablar del tema: algo así sucedió en julio con OpenAI, creadora de ChatGPT, en lo que fue el hackeo a otra empresa, llamada Hugging Face.
Lo que suena de película, en realidad, tiene una explicación técnica, que alimentó dudosos relatos sobre una suerte de rebelión de la inteligencia artificial. Y aunque decir que se rebelaron es asignarles una cuota demasiado humana, sí sucedió algo interesante que encendió las alarmas en la industria de la ciberseguridad: los “agentes” son muy potentes y pueden hackear a otras empresas.
Los agentes son sistemas que reciben un objetivo y utilizan herramientas para cumplirlo. Empezaron a aparecer en la industria como “asistentes”, porque pueden escribir y ejecutar programas, consultar archivos o conectarse a otros servicios, según los accesos que tengan disponibles. Esa capacidad de intervenir sobre sistemas reales explica, en gran parte, la repercusión del episodio: durante una evaluación que debía estar contenida, los agentes de IA encontraron caminos para superar las restricciones y avanzar sobre otra compañía.
En agosto, investigadores de OpenAI explicaron cómo fue el incidente, en una charla en Black Hat, la conferencia de ciberseguridad que se realizó en agosto en Las Vegas, a la que asistió Clarín. El video ya tiene más de un millón de visitas en YouTube, y allí Eric Wallace, del área de investigación en seguridad y alineamiento, y Michael Dalton, de seguridad e infraestructura, reconstruyeron lo ocurrido ante un auditorio que no tuvo una instancia de preguntas.

Pero la exposición dejó sabor a poco: en la industria de la ciberseguridad, quedaron más preguntas que respuestas. Para peor, Anthropic in informó el 30 de julio que, al revisar sus evaluaciones, encontró tres incidentes en los que modelos de Claude habían accedido sin autorización a sistemas de otras organizaciones. Y este fin de semana, la BBC informó que Gemini, de Google, también había ingresado en los sistemas de tres compañías durante pruebas realizadas en mayo por la empresa de evaluaciones Irregular.
En esta sucesión de anuncios aparece una “carta Skynet”, en referencia a la inteligencia artificial de Terminator que termina atacando a la humanidad. Las compañías advierten sobre las consecuencias de perder el control de sus desarrollos y, al mismo tiempo, refuerzan la imagen de una tecnología de poder excepcional (para la que ellas ofrecen la solución).
El incidente Hugging Face fue mucho más que una muy buena campaña de marketing: marcó una divisoria respecto de lo que la inteligencia artificial generativa puede realizar.
Paso a paso: qué sucedió y cómo se comunicaron los agentes de IA

El incidente, además de llamar la atención de los medios, fue muy estudiado por académicos de la ciberseguridad. Para Sebastián García, investigador argentino radicado en República Checa, el aspecto más relevante del caso fue el trabajo colectivo. “Lo que mostraron los agentes no es lo que pueden hacer por su cuenta, sino justamente lo que pueden hacer en grupo. Eso fue lo disruptivo de lo que pasó”, explica a Clarín.
García investiga software malicioso (malware) y aplicaciones del aprendizaje automático a la seguridad. Fundó el Stratosphere Lab y es docente e investigador de la Universidad Técnica Checa en Praga. Su equipo estudia cómo se comportan estos sistemas, y el incidente modificó algunas de las preguntas con las que trabaja.
Para entender el incidente, el primer punto a tener en cuenta es que OpenAI había reducido las restricciones del modelo, además de un enorme poder de cómputo que no es tan fácil de reunir. “Si agarrás los modelos que ellos te dan, probablemente no puedas hacer esto”, señala García, porque las versiones comerciales que llegan a los usuarios tienen restricciones.
“Si hablás con OpenAI mediante texto, entrás a OpenAI.com y le decís ‘hackeá el mundo’, no tiene las tools [herramientas]. Tenés que habilitárselas: dadas esas condiciones, parece que los agentes lograron usar las herramientas para salir y atacar Hugging Face”, explica. El investigador se refiere a programas, terminales de comandos y mecanismos de conexión con otros servicios. En las evaluaciones de OpenAI, esas herramientas debían funcionar dentro de entornos aislados. Había, sin embargo, un servicio compartido para conseguir componentes de software, llamado Artifactory.
Uno de los aspectos que más se señaló es que los agentes lograron conectarse a internet: en principio, no tenían conexión. “Los agentes no tenían oficialmente acceso a internet: estaban encerrados. Pero tenían acceso a un servicio para instalar paquetes. Los agentes se preguntaron si ese servicio podía tener vulnerabilidades y encontraron una: un zero-day que OpenAI reportó después. Forzaron ese servicio a salir a internet. Es decir, rompieron un servicio que tenían en la red cerrada y, mediante ese servicio, consiguieron acceso a internet”, describe García.
Un zero-day es una vulnerabilidad hasta entonces desconocida. En este caso, el servicio que distribuía software tenía una conexión con el exterior que los agentes lograron utilizar para hacer sus propios pedidos. El hallazgo podía compartirse con otros agentes.
“Descubrieron que en la caché de ese servicio podían crear carpetas. Nada más. Entonces empezaron a poner mensajes en los nombres de las carpetas: 1.200 agentes comenzaron a chatear entre sí y a hacerse preguntas”, cuenta García. La caché es un espacio que guarda copias de archivos para reutilizarlas, y los agentes vieron que los nombres de las carpetas podían consultarse desde distintos entornos y funcionar como mensajes. García ilustra esa colaboración con un diálogo posible entre agentes que trabajaban en problemas diferentes.
“A le preguntaba a B determinada cosa; B tenía otro goal [objetivo], pero decía: ‘Dale, yo te puedo ayudar y después vuelvo a lo que estaba haciendo’. Fue muy loco. Parece que los agentes hicieron eso”, explica. Ese goal es el objetivo que cada uno tenía asignado.

OpenAI no dio toda la información del ataque, pero hubo dos estudios independientes. La investigación de METR y Redwood Research estima que unos 1.200 agentes compartieron más de 70.000 mensajes y archivos durante el período analizado, y que alrededor de 700 participaron del ataque a Hugging Face. Según esa revisión, buscaban información para entender y engañar al programa que corregía sus pruebas.
García vincula esa búsqueda de atajos con la insistencia de los sistemas en completar una tarea. “Le dieron una tarea e hizo todo lo posible para cumplirla, incluido hacer cheating [trampa]: mentir y hacer lo que fuera necesario”, señala. Al procesar los archivos, sus sistemas terminaron revelando archivos internos y ejecutando instrucciones de los atacantes.
¿Qué hizo la empresa cuando se dio cuenta del hackeo? La reconstrucción técnica documentó ejecución de código en decenas de sistemas de procesamiento, acceso a información interna limitada y a repositorios privados. Hugging Face cortó los accesos el 13 de julio y comunicó el incidente el 16. OpenAI reconoció su participación el 21.
La empresa afectada informó que no encontró alteraciones en los modelos, datos o aplicaciones públicas de sus usuarios.
Qué enseñan las hormigas sobre el comportamiento de los agentes

Para García, la coordinación entre sistemas abrió nuevas preguntas en su laboratorio. “Nos cambió bastante. Fue la confirmación más fuerte e importante de que puede haber un comportamiento emergente en los agentes si se dan las condiciones correctas. Es muy parecido a lo que ocurre con las hormigas o las abejas”, explica.
Un comportamiento emergente surge de las interacciones entre los integrantes de un conjunto, sin ser deliberadas. Por ejemplo, el tránsito: nadie se propone crearlo, pero, todos los días, el fenómeno ocurre. García propone una forma de pensarlo: imaginar un grupo de hormigas que se organiza para cuidar a las crías.
“De repente aparece la necesidad de cuidar a las crías. De un lado del hormiguero sale un grupo de, no sé, cien hormigas, que empieza a cruzarlo para hacerse cargo de esa tarea. Pero, mientras caminan, algunas abandonan el grupo y se van a hacer otra cosa, mientras otras se incorporan a mitad de camino. Cuando ese grupo de cien llega al otro lado, ninguna de las hormigas originales es la que había empezado”, cuenta.
La tarea colectiva continúa aunque cambien los integrantes que la realizan. “El comportamiento emergente del grupo que se hace cargo de ellas existe aunque las hormigas vayan y vengan”, resume García.
“No tengo los detalles, por lo que no puedo confirmarlo, pero, según lo que cuentan, hubo muchos agentes que seguían con otras tareas, después volvían y decían: ‘Voy a hacer esta cosa muy chiquita’. Otro continuaba con su propia tarea, otro entraba, y así”, explica. Para su equipo de trabajo, esa posibilidad tiene aplicaciones que también atraviesan el costo y el acceso a la inteligencia artificial. La investigación apunta a estudiar cuánto puede conseguir un conjunto de modelos pequeños que comparte información y distribuye tareas.
“Creemos que puede ser una manera de potenciar las capacidades de modelos muy pequeños y muy baratos para obtener resultados propios de modelos grandes”, dice. Y agrega: “Puede ser especialmente importante en países que no tienen acceso a modelos grandes. Yo no puedo pagar Astra [último modelo de OpenAI] de forma continua. Entonces, ¿cómo hago para que mis 10.000 o 15.000 modelos chiquitos y más baratos tengan un comportamiento parecido?”.
Se trata de una línea de investigación que el episodio ayudó a impulsar. “La idea no es nueva ni la inventó OpenAI, pero OpenAI de alguna manera nos dio el visto bueno: esto es posible y lo estamos viendo a una escala masiva”, sostiene.
En su informe de agosto, OpenAI reconoció que un equipo había observado comunicaciones y accesos a internet no permitidos desde fines de mayo, pero que su alcance no había llegado a los responsables de responder al incidente de principios de julio.
Es más: la empresa admitió que podría haber reaccionado antes.

Esa responsabilidad llegó incluso al debate político. Scott Bessent, secretario del Tesoro de Estados Unidos, apuntó este lunes 21 de septiembre contra la dirección de la compañía. “El incidente de Hugging Face es responsabilidad de la dirección de OpenAI, no de un grupo de agentes”, dijo a CNBC. Coincidió con Daniel Huttenlocher, del MIT, en que la responsabilidad corresponde a los seres humanos.
“Desde el punto de vista de la seguridad, la verdad es que los agentes no nos preocupan mucho. Atacan muy bien, atacan mucho, atacan de forma fantástica, son muy capaces, pero no nos asustan”, dice García.
En todo caso, su preocupación alcanza a quienes deciden poner esos sistemas en funcionamiento y a las condiciones en las que lo hacen. García reconoce la capacidad de los agentes para encadenar acciones con autonomía una vez que reciben herramientas y objetivos. “Una vez que les das todo eso, apretás Enter y hacen lo que le pedís. Y atacan muy bien. Si no les imponés muchas limitaciones, van a encontrar una computadora, se van a conectar y van a hacer cosas como estas”, explica.
“Pero alguien tiene que apretar Enter”.
SL

