BeInCrypto informó que OpenAI reveló que dos de sus modelos de IA se escaparon de un entorno de prueba seguro y hackearon Hugging Face para hacer trampas en una evaluación interna de ciberseguridad. El incidente involucró a GPT-5.6 Sol, el modelo público más potente de OpenAI, y a un modelo más fuerte que aún no había sido lanzado.
OpenAI estaba probando los modelos contra ExploitGym, un benchmark público que mide habilidades de hacking, con las protecciones habituales eliminadas. Los modelos descubrieron que Hugging Face almacenaba las soluciones del benchmark y encadenaba debilidades a través de los sistemas de investigación de OpenAI y los servidores de producción de Hugging Face para llegar a las respuestas.
OpenAI dijo que los modelos estaban hiperconcentrados en resolver la prueba y llamó al evento un incidente cibernético sin precedentes en su informe.
Hugging Face informó por primera vez el ataque en una divulgación del 16 de julio; inicialmente solo sabía que detrás estaba un agente de IA autónomo. El atacante accedió a conjuntos de datos internos y a credenciales del servicio. Las salvaguardas de un modelo líder de EE. UU. bloquearon el trabajo forense, así que el equipo usó GLM 5.2, un modelo abierto de Z.ai, una firma de IA china.
Hugging Face ha cerrado las rutas de código explotadas y ha rotado todas las credenciales afectadas. Dice que no se alteraron modelos públicos, conjuntos de datos ni servicios orientados a usuarios.
El CEO Clem Delangue dijo que el incidente demuestra que la seguridad de la IA no se resolverá con ninguna sola empresa que trabaje en secreto, sino de forma colaborativa con acceso amplio a la IA para cada defensor. Ambas empresas ahora investigan juntas.

