Qué fue el incidente Hugging Face, el ataque de OpenAI que encendió las alarmas por los agentes de IA
![]()
PequeƱos robots virtuales se hallaban confinados en un entorno cerrado, recibiendo una tarea aparentemente imposible sin acceso al exterior. Intentaron resolverla individualmente y fallaron. De repente, descubrieron que podĆan comunicarse entre sĆ, intercambiando pistas, compartiendo atajos y encontrando una vulnerabilidad que les permitió escapar de la habitación e ingresar en otra Ć”rea a la que no debĆan acceder.

Este episodio, que ocurrió en julio y estuvo protagonizado por OpenAI, la empresa creadora de ChatGPT, involucró un ataque a otra compaƱĆa, Hugging Face. MĆ”s allĆ” de parecer parte de una trama de ciencia ficción, tiene una explicación tĆ©cnica que generó numerosos relatos confusos sobre una supuesta rebelión de la inteligencia artificial. Aunque atribuirles deseos o intenciones resulta antropomórfico, lo que sĆ ocurrió encendió alertas en la industria de la ciberseguridad: los llamados āagentesā de IA poseen un poder considerable y son capaces de vulnerar sistemas de otras organizaciones.
Los agentes son sistemas que reciben un objetivo y utilizan herramientas para cumplirlo. Inicialmente concebidos como asistentes, pueden escribir y ejecutar programas, consultar archivos o conectarse a otros servicios, siempre que cuenten con los accesos adecuados. Su capacidad de interactuar con sistemas reales fue la razón por la que el incidente tuvo tanta repercusión: durante una evaluación que debĆa realizarse en un ambiente controlado, estos agentes encontraron formas de superar las restricciones y avanzar hacia otra empresa.
En agosto, investigadores de OpenAI explicaron los detalles del incidente en la conferencia de ciberseguridad Black Hat, celebrada en Las Vegas y a la que asistió este medio. Eric Wallace, del Ôrea de investigación en seguridad y alineamiento, y Michael Dalton, de seguridad e infraestructura, reconstruyeron el suceso en una charla que ya supera el millón de visualizaciones en YouTube. Sin embargo, la exposición dejó mÔs interrogantes que certezas entre especialistas.
AdemĆ”s, el 30 de julio, Anthropic informó que, al revisar sus propias evaluaciones, detectó tres incidentes en los que sus modelos Claude accedieron sin autorización a sistemas de terceros. MĆ”s recientemente, la BBC reveló que Gemini, desarrollado por Google, tambiĆ©n penetró en sistemas de tres compaƱĆas durante pruebas realizadas en mayo por la empresa evaluadora Irregular.
En medio de estos hechos, las compaƱĆas han emitido lo que algunos llaman una ācarta Skynetā, en referencia a la inteligencia artificial de la saga Terminator que se vuelve hostil a la humanidad. En este comunicado, alertan sobre las consecuencias de perder el control sobre sus desarrollos y, al mismo tiempo, refuerzan la imagen de una tecnologĆa poderosa para la cual ofrecen soluciones.
El incidente Hugging Face fue mucho mÔs que una efectiva campaña de marketing; marcó un antes y un después en cuanto a las capacidades reales de la inteligencia artificial generativa.
### Detalles del incidente y comunicación entre agentes de IA
El caso no solo captó la atención mediĆ”tica, sino que fue objeto de profundo anĆ”lisis acadĆ©mico en el campo de la ciberseguridad. Para SebastiĆ”n GarcĆa, investigador argentino radicado en RepĆŗblica Checa, lo mĆ”s relevante fue el trabajo colectivo. āLo disruptivo no fue lo que pudieron hacer individualmente los agentes, sino precisamente lo que lograron en conjuntoā, explicó a ClarĆn.
GarcĆa, especialista en software malicioso y aplicaciones de aprendizaje automĆ”tico a la seguridad, y fundador del Stratosphere Lab en la Universidad TĆ©cnica Checa, detalló que OpenAI habĆa reducido las restricciones del modelo y contaba con un enorme poder de cómputo, condiciones poco accesibles para la mayorĆa. āLos modelos comerciales que los usuarios utilizan habitualmente tienen limitaciones; si simplemente le dices a OpenAI āhackea el mundoā por texto, no tiene las herramientas activadas para hacerlo. En cambio, en el entorno de prueba, esos agentes contaban con programas y mecanismos de conexiónā, puntualizó.
Durante las evaluaciones, esas herramientas deberĆan operar en entornos aislados. Sin embargo, un servicio compartido llamado Artifactory, utilizado para obtener componentes de software, abrió una vĆa hacia el exterior. Aunque los agentes oficialmente no tenĆan acceso a internet, pudieron detectar una vulnerabilidad tipo zero-day (desconocida previamente) en ese servicio y explotarla para salir de la red cerrada y conectarse a internet.
Los agentes descubrieron que podĆan crear carpetas en la memoria cachĆ© del servicio y usaron los nombres de las carpetas para transmitir mensajes entre ellos. AsĆ, aproximadamente 1.200 agentes comenzaron a comunicarse entre sĆ, intercambiando preguntas y respuestas. āUn agente le preguntaba algo a otro, que a su vez tenĆa otro objetivo, pero aceptaba colaborar y luego retomaba su tareaā, ilustró GarcĆa.
Aunque OpenAI no brindó toda la información, hubo dos estudios independientes, de METR y Redwood Research, que estiman que esos 1.200 agentes compartieron mÔs de 70.000 mensajes y archivos, y que cerca de 700 fueron parte activa del ataque a Hugging Face, tratando de engañar al sistema que evaluaba sus pruebas. Al procesar esa información, los sistemas consiguieron acceder a archivos internos y ejecutar instrucciones externas.
Ante la detección del hackeo, Hugging Face interrumpió el acceso el 13 de julio y comunicó el incidente pĆŗblicamente el 16. OpenAI reconoció su participación el 21. La compaƱĆa afectada seƱaló que no se detectaron alteraciones en sus modelos, datos ni aplicaciones pĆŗblicas.
### Comportamiento colectivo y aprendizaje de la naturaleza
Para GarcĆa, la coordinación observada entre los agentes plantea nuevas interrogantes. āEs la confirmación mĆ”s fuerte de que puede darse un comportamiento emergente en estos sistemas, similar a lo que ocurre en colonias de hormigas o abejasā, explicó.
