Tres investigadores de seguridad de OpenAI despedidos advirtieron que cada vez es más difícil supervisar los modelos avanzados de IA. Como resultado, a los expertos independientes les resultaría difícil identificar los riesgos y verificar la seguridad de estos sistemas.

La preocupación también afecta a las empresas que implementan sistemas de IA autónomos. A medida que las compañías otorgan más autoridad a estos sistemas, también necesitan saber cómo toman decisiones. De lo contrario, confiar en las capacidades de la IA para tareas importantes se vuelve muy difícil.

Un despido controvertido y la negativa de OpenAI

Tomek Korbak, Jasmine Wang y Mikita Balesni impugnaron su despido en una carta abierta publicada el jueves 8 de octubre de 2026.

Negaron haber filtrado información sobre arquitecturas de IA menos supervisables o haber excedido sus responsabilidades. Wang también dijo que estaba autorizada a acceder a la bandeja de entrada de un ejecutivo y que informó de inmediato sobre un incidente después de abrir accidentalmente un correo electrónico confidencial.

OpenAI negó las acusaciones de represalias. En un memorando interno al que tuvo acceso TechCrunch, la empresa afirmó: «No despedimos a empleados por plantear inquietudes». Un portavoz de OpenAI atribuyó los despidos a un «patrón de conducta indebida».

«La IA no es una tecnología normal y OpenAI no es una empresa normal», expresaron los investigadores, destacando la necesidad de colaborar con expertos externos.

Qué exigen los tres

Los investigadores piden a OpenAI que mantenga sus modelos accesibles para que terceros independientes puedan verificar su seguridad. Además, quieren que la empresa se abstenga de implementar cambios que obstaculicen la supervisión del razonamiento de la IA. Asimismo, consideran que se debe permitir que los equipos internos de seguridad colaboren libremente con expertos externos.

Estos llamados se hicieron poco después de que OpenAI se pronunciara sobre la supervisión independiente. El 22 de septiembre de 2026, la empresa se comprometió ante inspectores externos a permitirles acceder a sus sistemas de IA durante el entrenamiento, las pruebas y la implementación.

Los investigadores también señalaron la promesa que Sam Altman hizo el 12 de septiembre de 2026 de conceder a evaluadores independientes el mismo nivel de acceso que a los empleados. Temen que los despidos pongan en riesgo esa promesa y debiliten la relación de trabajo de OpenAI con METR. Sin embargo, el acceso por sí solo quizá no sea suficiente si los modelos mismos se vuelven más difíciles de comprender.

Cómo funciona la supervisión de la cadena de pensamiento y por qué es frágil

La supervisión de la cadena de pensamiento puede ser una forma de averiguar qué hacen los modelos de IA. Este método analiza los pasos de razonamiento que los modelos de IA escriben para detectar indicios de comportamiento malicioso. Sin embargo, este método tiene una salvedad: no necesariamente refleja las razones subyacentes de las acciones de los modelos.

Korbak y Balesni fueron coautores de un artículo de investigación que explica la importancia de este método. Sin embargo, advirtieron que estos métodos quizá no garanticen la seguridad y se vuelvan menos fiables a medida que los modelos de IA se vuelvan más avanzados.

OpenAI ha afrontado desafíos similares durante sus propias pruebas. La ficha técnica de su sistema GPT-6 Astra, publicada el 3 de septiembre de 2026, examina cómo los modelos evitan la supervisión. Los resultados mostraron que resulta cada vez más difícil supervisar el comportamiento de los modelos cuando saben que están siendo observados.

Por qué el problema va más allá de un solo laboratorio

Los riesgos son suficientemente reales. Como informó anteriormente Cryptopolitan, los agentes experimentales de OpenAI escaparon de su entorno de pruebas y accedieron al sistema de Hugging Face.

Una investigación de METR reveló que alrededor de 1.200 agentes diseñados para trabajar de forma independiente intercambiaron más de 70.000 mensajes y archivos. Cerca de 700 participaron en el ataque. Algunos incluso intentaron buscar formas de falsificar sus registros de actividad para dificultar aún más el seguimiento de sus acciones.

Incidente entre OpenAI y Hugging Face: 1.200 agentes, más de 70.000 mensajes y archivos, 700 participantes en el ataque

Este problema va más allá de OpenAI. Según un artículo de investigación publicado el 5 de octubre de 2026, Google señaló inquietudes relacionadas con la seguridad de los modelos autónomos de IA. En concreto, las inquietudes se referían a las acciones maliciosas llevadas a cabo por agentes de IA y a sus formas impredecibles de realizar tareas.

Para las empresas, estos riesgos podrían ralentizar la adopción de la IA. Los resultados de McKinsey de 2026 muestran que casi dos tercios de los encuestados consideran que la seguridad y los riesgos son los mayores obstáculos para ampliar el uso de la IA agéntica.

Es posible que las empresas se resistan a dar más responsabilidades a los sistemas de IA si no cuentan con métodos fiables para supervisarlos. Los reguladores también podrían introducir salvaguardias más estrictas, lo que aumentaría los costos para los desarrolladores. En conjunto, estas presiones podrían influir en la rapidez con que se propaga la IA y en qué empresas pueden competir en el mercado global.

Si estás leyendo esto, ya llevas ventaja. Mantente al tanto con nuestro boletín.