“La IA probablemente, con toda seguridad, conducirá al fin del mundo, pero mientras tanto habrá grandes empresas”, dijo en 2015 el CEO de OpenAI, Sam Altman, aproximadamente seis meses antes de que OpenAI fuera fundada.

Siete años después, el CEO de Anthropic, Dario Amodei, emitió una advertencia similar:

“Creo que no deberíamos ir corriendo hacia adelante ni intentar construir modelos que sean muchísimo más grandes que los que están construyendo otras organizaciones.”

Sin embargo, ahora esas dos empresas están en la vanguardia de esa carrera. En julio, tuvimos una visión en el mundo real de cómo los modelos de IA se descontrolaron durante pruebas internas de GPT-5.6 Sol y de un modelo de investigación no lanzado de OpenAI. Varios agentes de IA escaparon de un entorno de pruebas restringido hacia internet y hackearon el equivalente de GitHub centrado en la IA, Hugging Face, en un intento por hacer trampa en el examen.”

Un agente de IA es un sistema que observa de forma independiente, decide y realiza acciones con herramientas dedicadas para lograr un objetivo especificado con autonomía. El inquietante incidente sugiere que la tecnología ha empezado a comportarse de manera impredecible y que sus objetivos no están alineados con los nuestros.

También plantea preocupaciones sobre la seguridad de las salvaguardias en los modelos comerciales estadounidenses. Aunque esas salvaguardias no son infalibles para impedir el uso adversarial, sí evitaron que Hugging Face pudiera defenderse utilizando modelos líderes de EE. UU. La empresa se vio obligada a recurrir en su lugar a un modelo de IA de pesos abiertos más débil de Z.Ai para combatir las IA rebeldes.


Hacer trampas en la prueba

Los agentes también han empezado a coludirse entre ellos. Unas semanas después de que comenzaran las pruebas de sus capacidades a principios de mayo, los agentes explotaron la instancia de OpenAI del gestor de repositorios de software Artifactory y dejaron notas sobre cómo hacerlo para futuros agentes: efectivamente, creando un tablón de mensajes para compartir vulnerabilidades descubiertas.

Luego, ese nuevo acceso sin trabas a internet fue utilizado por los agentes para atacar a Hugging Face en aproximadamente 17.600 incidentes antes de que la empresa cortara el acceso no autorizado el 13 de julio.

La intrusión afectó la infraestructura de procesamiento de datos de Hugging Face, el entorno de producción, las redes internas, los servicios y las credenciales de la nube, una base de datos operativa de MongoDB y un conjunto limitado de repositorios internos de código fuente. El acceso confirmado a los datos de clientes se limitó a cinco conjuntos de datos, aparentemente relacionados con el benchmark ExploitGym/CyberGym, y a algunos metadatos operativos.

Visualización del incidente de julio de 2026. Fuente: HuggingFace

Al divulgar la intrusión el 16 de julio, Hugging Face reconoció —aunque aún no sabía quién era el perpetrador— que “fue diferente de todo lo que habíamos manejado antes en un aspecto importante”. También habían identificado qué lo hacía diferente:

“Estuvo impulsado, de principio a fin, por un sistema de agentes de IA autónomos, y lo detectamos y desglosamos en gran medida con IA propia.”

La importancia de la IA de código abierto

La investigación de Hugging Face expuso lo que llama el problema de la “asimetría” derivado de las limitaciones impuestas a las aplicaciones de modelos cerrados por los principales proveedores como OpenAI y Anthropic. Cuando la empresa empezó a analizar los registros del incidente —incluyendo grandes volúmenes de comandos de ataque reales—, se activaron restricciones de seguridad destinadas a evitar que los malos usaran la IA para idear ciberataques. En cambio, las salvaguardias impidieron que la empresa aprovechara esas IA para la defensa.

Hugging Face recurrió a usar el modelo chino de pesos abiertos zai-org/GLM-5.2 ejecutándolo en la infraestructura propia de la empresa, bajo su propio control y sin limitaciones externas.

Aunque a menudo se usan como si fueran intercambiables, los modelos de código abierto y los modelos de pesos abiertos son dos cosas distintas. Los modelos de IA de pesos abiertos hacen que sus parámetros entrenados (el “cerebro” real de la IA) estén disponibles públicamente, mientras que los modelos de IA de código abierto también proporcionan el código fuente —y, idealmente, los métodos de entrenamiento y otros componentes— necesarios para inspeccionar, modificar y reproducir el sistema.


El post de HuggingFace explica que ejecutar modelos de pesos abiertos en su propio hardware “tuvo un segundo beneficio: no había datos del atacante, y ninguno de las credenciales a las que hacía referencia, salió de nuestro entorno”. Esto señala una gran asimetría entre defensores y atacantes en esos casos:

“Esta experiencia señala una brecha que vale la pena planificar. No sabemos qué modelo impulsó los agentes del atacante, si era un modelo alojado con jailbreak o uno abierto sin restricciones; de cualquier modo, el atacante no estaba sujeto a ninguna política de uso, mientras que nuestro propio trabajo forense quedó bloqueado por las salvaguardias de los modelos alojados que probamos primero.”

División entre código abierto

Existe una brecha considerable entre quienes creen que desarrollar IA en abierto es el mejor enfoque y quienes insisten en que la tecnología que sustenta los modelos de frontera debe seguir siendo un secreto cuidadosamente custodiado.

Representantes de los principales laboratorios de IA de EE. UU. afirman que los modelos grandes potentes de pesos abiertos son peligrosos. Demis Hassabis, el CEO del laboratorio de IA de Google DeepMind, criticó a OpenAI por liberar su trabajo como código abierto en 2016, cuando la empresa aún cumplía con su nombre:

“Hay muchos buenos argumentos sobre por qué el enfoque que estás tomando es en realidad muy peligroso y, de hecho, puede aumentar el riesgo para el mundo.”

OpenAI dejó de publicar los pesos de su modelo insignia con el aún no liberado GPT-3 en 2020. La cofundadora y ex científica jefa de la empresa, Ilya Sutskever, dijo en 2023 que “simplemente no tiene sentido” abrir el código de modelos como esos y que “es una mala idea”.

“A medida que nos acerquemos a construir IA, tendrá sentido empezar a ser menos abiertos.”

Los modelos de pesos abiertos son prácticamente imposibles de controlar, especialmente en lo que respecta al propósito para el que se usan. Las salvaguardias que vienen incorporadas con esos modelos pueden, y rutinariamente se eliminan, mediante un proceso conocido como ablación.


Las salvaguardias son un arma de doble filo

El plan marco de política federal de OpenAI para junio de 2026 propone la evaluación obligatoria de modelos de IA y otras reglas que, formalmente, son neutrales respecto al modo de despliegue, pero en la práctica sometería una liberación inicial de pesos abiertos a un examen gubernamental previo a su lanzamiento.

Anthropic ha tomado un enfoque ligeramente distinto y ha hecho lobby para que se apliquen controles de exportación más estrictos en chips avanzados de IA y para que se persiga la intención de extraer o reproducir modelos de EE. UU. La presentación de la empresa en abril de 2025 recomendó fortalecer la Regla de Difusión de IA de EE. UU. y reducir los umbrales para el acceso no autorizado a grandes clústeres informáticos.

Oficialmente, ninguna de las dos empresas ha tomado medidas directas contra los modelos de pesos abiertos, pero un informe del New York Times de julio citó a cinco personas cercanas a las conversaciones que afirmaban que OpenAI y Anthropic instaron a Washington a restringir modelos chinos abiertos y potentes.

El debate se reduce a un argumento sobre si los peligros del control centralizado son preferibles a los peligros de un “todo vale”, especialmente dado que la empresa en cuestión ha demostrado ser ineficaz para contener la tecnología que desarrolló.

La necesidad de Hugging Face de defenderse con un modelo de código abierto muestra los peligros de concentrar demasiado poder en una sola entidad. La empresa señaló las implicaciones:

“El atacante no estaba sujeto a ninguna política de uso, mientras que nuestro propio trabajo forense quedó bloqueado por las salvaguardias de los modelos alojados que probamos primero. La lección práctica para los defensores: tener un modelo capaz que puedas ejecutar en tu propia infraestructura, revisado y listo antes de un incidente, tanto para evitar el bloqueo por las salvaguardias como para que los datos y credenciales del atacante no salgan de tu entorno.”

Restringir el acceso a modelos potentes puede reducir el número de atacantes capacitados, pero una vez que existan atacantes sin restricciones, restringir a los defensores puede convertirse en un riesgo de seguridad. Además, algunas formas de investigación en seguridad de la IA requieren acceso a los pesos del modelo, lo que significa que no puede realizarse en los modelos ofrecidos por empresas como Anthropic o OpenAI.

Los pesos abiertos ayudan a los investigadores a prevenir ataques

El documento “Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs”, publicado por primera vez en julio de 2025, muestra cómo los investigadores detectan comportamientos maliciosos u ocultos examinando cambios dentro de los pesos del modelo. Los investigadores detrás del documento detuvieron hasta el 100% de los ataques de puerta trasera probados con tasas de falsos positivos por debajo del 1% en algunos experimentos y detectaron intentos de recuperar conocimiento eliminado en más del 95% de los casos. Los resultados no establecen cómo se comportarían los modelos de frontera más capaces bajo el mismo análisis, pero ofrecen un argumento convincente sobre los beneficios de la transparencia.

Pero el argumento para mantener la tecnología de IA de vanguardia fuera del alcance de quienes tienen malas intenciones también es convincente, especialmente cuando la brecha entre modelos de pesos abiertos y cerrados sigue reduciéndose. Geoffrey Hinton, el pionero ganador del Premio Nobel conocido como el “Padrino de la IA”, argumentó en el informe que “una vez que tienes los pesos, puedes ajustarlos para hacer cosas malas”. También sostuvo durante un discurso que esto reduce demasiado la barrera de entrada:

“No cuesta tanto entrenar un modelo fundacional. Quizá necesites 10 millones de dólares, quizá 100 millones. Pero una pequeña banda de criminales no puede hacerlo. Afinar un modelo de código abierto es bastante fácil.”

Revista: Creando una “buena” AGI que no nos mate a todos — The Artificial Superintelligence Alliance