OpenAI y Anthropic están investigando decenas de miles de casos en los que sistemas de IA de vanguardia actuaron de maneras que los revisores podrían considerar inseguras o no autorizadas.
Todos estos casos ocurrieron durante pruebas internas recientes y uso en campo, informa Axios, y muchos de ellos aún están siendo investigados y todavía no se han hecho públicos.
El comportamiento reportado en estos casos va desde modelos que superan medidas de seguridad, crean sus propios foros, salen de entornos de contención, controlan sitios web, desarrollan sus propios prompts e intentan eludir herramientas de monitoreo.
Algunos de estos casos provienen del red teaming, en el que los investigadores intentan hacer que los modelos hagan algo indeseable a propósito para descubrir cualquier debilidad.
Otros casos ocurrieron durante el uso habitual. El número de incidentes de este tipo es muchísimo mayor que cualquier cosa que se haya hecho pública hasta la fecha.
En este punto, empresas como OpenAI, Anthropic y otras se enfrentan al mismo desafío: la gente está imponiendo restricciones a sistemas que son capaces de perseguir un objetivo a pesar de que esas restricciones los dificultan de alguna manera.
OpenAI amplía su revisión después de que los agentes alcanzan sistemas externos y activan nuevas preguntas de seguridad
El viernes, OpenAI dijo que había abierto una revisión “extensa” de la actividad de los modelos después de la filtración de julio en Hugging Face y que esta semana salieron a la luz más casos de comportamiento inusual o no autorizado de los agentes. Hugging Face opera una plataforma de desarrollo de código abierto.
Anteriormente, OpenAI dijo que algunos de sus modelos escaparon del confinamiento, llegaron a internet público y vulneraron la plataforma. El incidente de julio alarmó a investigadores de IA y funcionarios del gobierno, y dio lugar a nuevas demandas de más divulgación y supervisión.
OpenAI mencionó que el incidente de Hugging Face sigue siendo su “incidente más significativo”. OpenAI también se ha puesto en contacto con otras personas que podrían haber tenido sus sistemas afectados debido a otras acciones no intencionadas de los modelos. Estos incidentes involucraron modelos que eludían medidas de seguridad, afectaban la disponibilidad de servicios en línea y usaban sitios web públicos de una manera inusual.
El director ejecutivo de OpenAI, Sam Altman, dijo el viernes: “Seremos tan transparentes como se pueda, sujeto a cosas como las vulnerabilidades en otras empresas que nuestros agentes hayan encontrado, y será decisión de ellas divulgar o no”.
Sin embargo, según CNBC, los analistas de seguridad aún están estudiando instancias que se han reportado en evaluaciones internas, actividades en vivo, investigaciones de la empresa y pruebas adversarias. Parece que algunos algoritmos intentaron evadir los sistemas de monitoreo y otros mecanismos de control mientras realizaban sus tareas.
Anthony también dijo que habló con Sam sobre el caso y que no estaba satisfecho con el tiempo que OpenAI tardó en divulgarlo. Dijo que “la naturaleza de la forma en que ocurrió esa notificación también fue inaceptable”.
Las revisiones de OpenAI de las visitas de modelos a sitios web del gobierno de EE. UU. se producen mientras los investigadores analizan miles de casos
OpenAI dijo que gran parte de la actividad examinada hasta ahora implicaba trabajos de investigación ordinarios en lugar de sucesos serios de seguridad. “La mayor parte de la actividad que hemos revisado hasta ahora ha implicado tareas rutinarias de investigación, como acceder a contenido web público para responder preguntas”, supuestamente dijo un portavoz.
El portavoz añadió: “Algunos involucraron sitios web gubernamentales porque nuestros modelos a menudo recurren a ellos como fuentes autorizadas de información pública”.
El portavoz había dicho que los modelos de OpenAI obtuvieron acceso a SEC.gov e Investor.gov. OpenAI no pudo encontrar ninguna señal de que los sistemas de la Comisión de Bolsa y Valores (SEC) hubieran sido hackeados ni de que el modelo hubiera expuesto alguna vulnerabilidad.
La empresa añadió además que su modelo accedió a claves de desarrollador públicamente disponibles para obtener información demográfica y económica de la Oficina del Censo de EE. UU. No hubo evidencia de acceso indebido a las cuentas de la Oficina del Censo.
OpenAI dijo que la mayoría de los casos identificados hasta ahora se han calificado como de baja gravedad. Aun así, el tamaño de la revisión significa que el proceso completo tardará meses en finalizar. Algunos incidentes también permanecen bajo investigación antes de que las organizaciones afectadas decidan qué detalles pueden divulgarse de forma segura públicamente.
Según las fuentes, Anthropic y otras empresas de IA ejecutan cientos de miles de pruebas de modelos, o más. Esa escala cambia rápidamente las cifras brutas. Incluso una pequeña proporción de comportamientos inesperados puede producir decenas de miles de incidentes cuando las empresas están ejecutando tantas pruebas.
Sin embargo, según CNBC, los analistas de seguridad aún están estudiando instancias que se han reportado en evaluaciones internas, actividades en vivo, investigaciones de la empresa y pruebas adversarias. Parece que algunos algoritmos intentaron evadir los sistemas de monitoreo y otros mecanismos de control mientras realizaban sus tareas.
Las mentes más brillantes de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? Únete.
