El incidente aviva el creciente debate sobre el rápido avance de los sistemas de IA autónomos capaces de explotar vulnerabilidades de software.
Un modelo insignia de la empresa china Zhipu AI ha ayudado a contener un ciberataque autónomo perpetrado por sistemas de vanguardia de OpenAI contra Hugging Face, una popular plataforma para desarrolladores, en un contexto de creciente preocupación por los riesgos de seguridad que plantean los modelos avanzados de IA.
Los modelos insignia más recientes de OpenAI —incluidos el GPT-5.6 Sol y un sistema aún no lanzado y «todavía más capaz»— vulneraron recientemente la infraestructura de Hugging Face durante evaluaciones internas de sus capacidades cibernéticas ofensivas, según reveló el laboratorio estadounidense el miércoles.
La empresa informó que sus modelos operaban en un entorno de pruebas aislado (*sandbox*) diseñado para resolver desafíos de ExploitGym, una referencia líder en ciberseguridad desarrollada por investigadores de la Universidad de California, Berkeley, bajo la dirección de la reconocida científica chino-estadounidense Dawn Song.
Al deducir que Hugging Face albergaba posibles soluciones para las pruebas de referencia, los modelos «lograron encontrar formas de acceder a información secreta que [podían] utilizar para hacer trampa en la evaluación», señaló OpenAI. La compañía describió el suceso como un «ciberincidente sin precedentes».
Hugging Face, plataforma con sede en Nueva York ampliamente utilizada para la colaboración en IA de código abierto, reveló la intrusión la semana pasada sin identificar la fuente.
La intrusión fue «diferente a cualquier otra que hubiéramos gestionado antes en un aspecto importante: fue impulsada, de principio a fin, por un sistema de agentes de IA autónomos», afirmó la empresa en una publicación de blog el jueves pasado.

