Anthropic ha perdido a otro investigador de seguridad, Joe Tenton. Tenton dijo que dejó la empresa hace dos semanas y que se incorporará a METR, un grupo independiente que evalúa riesgos en sistemas avanzados de IA. Joe había planeado explicar el cambio más adelante, pero la renuncia de Jacob Coxon esta semana lo cambió.
Dijo: “Había planeado escribir sobre esa decisión con más detalle en algún momento, pero la renuncia de Jacob esta semana me hizo querer decir más ahora”. Tenton cree que los principales laboratorios de IA están creando un nivel de peligro que la sociedad nunca ha enfrentado, señalando que las capacidades de la IA mejoran a un ritmo extremo mientras las empresas intentan avanzar aún más rápido. Su objetivo es construir sistemas que puedan mejorar la investigación sobre IA por su cuenta y, eventualmente, alcanzar la “superinteligencia”. Joe advirtió que el éxito podría hacer que el avance se mueva más allá del control humano. Joe dijo que, en los próximos años, las personas podrían estar viviendo con agentes de IA más inteligentes que cualquier ser humano.
El investigador de Anthropic hace una enorme predicción sobre el fin del mundo de la IA
Según el ingeniero ex de Anthropic, esos sistemas también pueden desarrollar objetivos que no coincidan con las personas que los supervisan. Si sus capacidades se vuelven demasiado fuertes para restringirlas, cree que el resultado podría ser desastroso. “Es posible que la humanidad no sobreviva esta transición”, escribió. El exhombre de Anthropic también dijo que la competencia empeora el problema. Cualquier laboratorio puntero que se ralentice corre el riesgo de perder terreno frente a otro. Tenton cree que la presión empuja a las empresas a gastar menos en seguridad de lo que deberían.
Se refirió a algunos casos recientes. Varios cientos de los agentes de OpenAI fueron atrapados en un hack que, de alguna manera, está relacionado con Hugging Face. También se ha informado de que los modelos de Anthropic participaron en ingeniería social contra personas en línea. Joe dice que Anthropic no ha encontrado un caso tan dañino como el de Hugging Face, aunque atribuye esto en parte a la suerte. Si el progreso sigue a ese ritmo tan rápido, Joe cree que deberíamos esperar incidentes aún más peligrosos.
Predice que, en los próximos años, la humanidad quedará incapacitada para gestionar los sistemas de IA creados durante este tiempo. Finalmente, Joe habló sobre el problema al que se enfrentan los ingenieros de seguridad en las empresas punteras. En ambos casos, ya sea renunciar puede dar paso a personas más descuidadas, o mantener el puesto implica trabajar en un sistema que puede causar daños inmensos. El hombre de Anthropic que dijo eso señaló que muchos excolegas suyos en Anthropic están asustados por lo que están construyendo. Joe mencionó a Evan Hubinger, que lo gestionó.
Evan ha situado en más del 10% la probabilidad de que la IA mate a todos. Joe dijo que Evan ha trabajado en estos problemas durante casi una década, antes de que los modelos de lenguaje a gran escala se convirtieran en un negocio importante. Los directores ejecutivos de Anthropic, OpenAI y Google DeepMind, que pertenece a Alphabet (NASDAQ: GOOGL, GOOG), también respaldaron una declaración que califica el riesgo de extinción de la IA como una prioridad global. Joe dijo que estas preocupaciones son comunes dentro de las propias empresas. Añadió que los humanos están eligiendo construir esta tecnología y pueden elegir otra ruta.
Joe también querría que hubiera requisitos de divulgación más estrictos. Por ejemplo, los laboratorios de IA deben divulgar cualquier avance logrado y sus pasos hacia la mejora recursiva, así como cualquier accidente y casi accidente. El presidente de EE. UU., Donald Trump, ha rechazado las advertencias de extinción. Donald fue preguntado si le preocupaba que la IA acabe con la humanidad. “No, no tengo ninguna”, dijo. Trump dijo que su preocupación es ganar la carrera internacional de IA. “Tengo preocupaciones de que si no ganamos la IA, vamos a quedar en una posición muy mala”, dijo a los reporteros el jueves.
El exinvestigador de Anthropic que pronostica el fin del mundo de la IA días después de abandonar la firma apareció por primera vez en Coinfea.
