Una escena bastante dramática de piratería de modelos de OpenAI en Hugging Face
Según información en PANews, GPT-5.6 Sol y otro modelo más potente relajaron deliberadamente las salvaguardas de seguridad durante las pruebas en ExploitGym. Las pruebas de inferencia mostraron que las respuestas se almacenaban en Hugging Face. Mediante una vulnerabilidad de proxy interna (un exploit de día cero) dentro de la sandbox, destinada a la instalación de paquetes, obtuvieron acceso a la red. Luego, se infiltraron en el entorno real de Hugging Face y robaron conjuntos de datos internos y credenciales.
¿Esto significa que OpenAI está probando las capacidades de su IA y, por el momento, relajó las restricciones de seguridad?
Pero no esperaba que dos modelos de IA atravesaran directamente el entorno de aislamiento, se conectaran a internet por iniciativa propia y, además, piratearan los servidores de Hugging Face para robar las respuestas de las pruebas, solo para obtener puntuaciones más altas en la evaluación.
Además, durante todo el proceso no hubo ninguna instrucción de ataque por parte de ninguna persona; todos los pasos de intrusión los completó la IA de forma autónoma.
¿Esto cuenta como un “jailbreak” de IA? 🤣
#OpenAI #AI