Anthropic ha perdido otro investigador de seguridad. Joe Tenton dijo que dejó la empresa hace dos semanas y se unirá a METR, un grupo independiente que evalúa riesgos en sistemas avanzados de IA.
Joe había planeado explicar el movimiento más adelante, pero la renuncia de Jacob esta semana cambió eso. Dijo:
«Había planeado escribir sobre esa decisión con más detalle en algún momento, pero la renuncia de Jacob esta semana me hizo querer decir más ahora.»
Joe cree que los grandes laboratorios de IA están creando un nivel de peligro al que la sociedad nunca se había enfrentado, diciendo que la capacidad de la IA mejora a una velocidad extrema mientras las empresas intentan avanzar aún más rápido.
Su objetivo es construir sistemas que puedan mejorar la investigación de la IA por sí mismos y, eventualmente, alcanzar la “superinteligencia”. Joe advirtió que el éxito podría hacer que el progreso se salga del control humano.
Joe dice que los laboratorios de IA compiten por llegar a sistemas que los humanos quizá no puedan contener
Joe dijo que la gente podría estar viviendo con agentes de IA más inteligentes que cualquier ser humano en los próximos pocos años. Esos sistemas también pueden desarrollar objetivos que no coincidan con las personas que los supervisan. Si sus capacidades se vuelven demasiado fuertes para restringirlas, él cree que el resultado podría ser desastroso. “Es posible que la humanidad no sobreviva esta transición”, escribió.
Dijo que la competencia empeora el problema. Cualquier laboratorio puntero que reduzca el ritmo corre el riesgo de perder terreno frente a otro. Joe cree que la presión empuja a las empresas a gastar menos en seguridad de lo que deberían.
Se refirió a algunos casos recientes. Varios cientos de los agentes de OpenAI quedaron atrapados en un hack que de alguna manera está relacionado con Hugging Face. También se informó que los modelos de Anthropic participaron en ingeniería social contra personas en línea.
Joe dice que Anthropic no ha encontrado un caso tan dañino como el de Hugging Face, aunque atribuye esto en parte a la suerte.
Si el progreso continúa a un ritmo tan acelerado, Joe cree que deberíamos esperar incidentes aún más peligrosos. Predice que en los próximos pocos años, la humanidad quedará sin poder para gestionar los sistemas de IA creados durante este periodo.
Por último, Joe habló sobre el problema que enfrentan los ingenieros de seguridad en las empresas punteras. En ambos casos, ya sea renunciar puede dar paso a personas más descuidadas o conservar el puesto implica trabajar en un sistema que puede causar un daño inmenso.
Dijo que muchos antiguos colegas de Anthropic están asustados por lo que están construyendo. Joe mencionó a Evan Hubinger, que lo gestionaba. Evan ha puesto la probabilidad de que la IA mate a todos por encima del 10%. Joe dijo que Evan ha trabajado en estos problemas durante casi una década, antes de que los modelos de lenguaje a gran escala se convirtieran en un negocio importante.
Los directores ejecutivos de Anthropic, OpenAI y Google DeepMind, que pertenece a Alphabet (NASDAQ: GOOGL, GOOG), también respaldaron una declaración que califica el riesgo de extinción por IA como una prioridad global. Joe dijo que estas preocupaciones son comunes dentro de las propias empresas. Añadió que los humanos están eligiendo construir esta tecnología y que pueden elegir otra ruta.
Joe impulsa controles más allá de la IA mientras Donald Trump se centra en derrotar a China
Joe dijo:
“Una pregunta es si deberíamos gestionar activamente la tasa del progreso de las capacidades y, si es así, en qué medida. Creo que incluso mantener el progreso de la IA al ritmo de hoy, en lugar del ritmo mucho más rápido que las empresas están apuntando a alcanzar, podría ser una victoria.”
Los problemas más grandes son el apoyo político y la protección legal. Las empresas que acordaran conjuntamente frenar el desarrollo podrían enfrentar problemas de competencia desleal. Joe dijo que eso hace necesaria una cobertura legal si los responsables de las políticas quieren que los laboratorios rivales se contengan.
También duda de que los gobiernos actúen mientras el desarrollo puntero permanezca oculto al público. Joe advirtió que un laboratorio podría experimentar un salto repentino de inteligencia o perder el control de un sistema sin que los de afuera se enteren.
Según él, su nuevo trabajo en METR se centrará en las pruebas independientes. Quiere que las revisiones externas se vuelvan lo bastante normales como para cambiar los incentivos de la empresa.
Joe también quisiera requisitos de divulgación más estrictos. Por ejemplo, los laboratorios de IA necesitan divulgar cualquier avance logrado y sus pasos hacia la mejora recursiva, así como cualquier accidente y casi accidente.
El presidente de Estados Unidos, Donald Trump, rechazó las advertencias de extinción. Le preguntaron a Donald si la IA que elimina a la humanidad le preocupaba. “No, no tengo ninguna”, dijo.
Donald dijo que su preocupación es ganar la carrera internacional de la IA. “Tengo preocupaciones de que si no ganamos la IA, vamos a quedar en una posición muy mala”, dijo a los reporteros el jueves. “Ahora mismo estamos liderando a China por un periodo bastante bueno, yo diría de un año, que, ya sabes, se considera mucho.”
Estados Unidos y China compiten por el liderazgo en IA a medida que los modelos chinos se vuelven más capaces y ganan usuarios en todo el mundo. Donald hizo esos comentarios después de que investigadores de laboratorios punteros, incluidos Anthropic y OpenAI, aumentaran sus advertencias públicas sobre la velocidad del desarrollo de la IA.
Si estás leyendo esto, ya vas por delante. Mantente ahí con nuestro boletín.
