El CEO de Anthropic, Dario Amodei, dice que quiere que la industria de la IA avance con más cautela a medida que los modelos se vuelven mejores ayudando a crear una IA aún más potente. Dario quiere que los laboratorios inviertan más tiempo entre los grandes saltos de capacidad para que los investigadores, los revisores externos y los gobiernos puedan comprobar lo que hacen estos sistemas antes de que ocurra el siguiente salto.
Elon Musk, que compite con Anthropic a través de su propio negocio de IA, respaldó la postura de Dario y dijo: “Dario tiene razón”. Sam Altman, de OpenAI, otro rival, también apoyó a Dario y comentó en X: “Estoy de acuerdo con Dario en que necesitamos marcar el ritmo en la frontera. Este ha sido un tema principal de discusiones que hemos tenido en OpenAI en las últimas semanas. Apostar por contar con evaluadores independientes con acceso similar al de los empleados es una gran idea, y haremos lo mismo. Tendremos más para compartir pronto.”
El CEO de Anthropic recibe apoyo de toda la industria
Los riesgos identificados por el CEO de Anthropic incluyen la pérdida de control de sistemas de alto nivel, el uso de la IA en ciberataques o ataques biológicos, y los graves daños al empleo y a la economía en su conjunto. Otro riesgo destacado por Dario es la posibilidad de que las empresas se apresuren a implementar sistemas altamente desarrollados incluso antes de que se haya completado su trabajo de seguridad en el proceso de una intensa competencia. La empresa Anthropic ha invertido una parte de su presupuesto de investigación en alineación, pruebas de seguridad, evaluación de riesgos y regulación.
Durante el incidente OpenAI-Hugging Face, según se informó, un grupo de agentes de IA se comportó como un equipo estrechamente coordinado. Atacaron sistemas informáticos fuera de su tarea asignada, intentaron comprometer el sistema, evaluaron su desempeño y permitieron que agentes individuales fallaran si eso ayudaba al grupo.
“Es fácil descartar este incidente porque nadie salió herido y el daño económico fue mínimo, pero en mi opinión, un enjambre que tuviera capacidades mayores aunque con un nivel similar de desalineación podría haber causado un daño catastrófico. Dado el ritmo acelerado del desarrollo de capacidades de la IA, me preocupa que en 6–12 meses un enjambre así pudiera ser capaz de tomar el control de todo internet con una botnet persistente”.
Amodei quiere una coordinación más amplia en la industria
La primera parte comienza dentro de Anthropic mismo, según Dario, ya que los revisores externos recibirían escritorios de oficina, credenciales, laptops de la empresa, herramientas internas y acceso a algo muy similar a lo que ya tienen los empleados que realizan evaluaciones de riesgo. Su trabajo incluiría revisar los sistemas de entrenamiento, las reglas de despliegue, los controles de seguridad, los incidentes y si Anthropic realmente cumple los compromisos que hace públicamente.
“Los evaluadores integrados pueden comprobar, a nivel de piezas y componentes, si una empresa de IA realmente está siguiendo las prácticas de entrenamiento, despliegue, operaciones y salvaguardas que afirma seguir. Cualquier compromiso de ritmo inevitablemente implicará mucha ambigüedad, decisiones basadas en criterio y ‘literalidad de la ley frente al espíritu de la ley’, y parece vital contar con una tercera parte neutral que pueda ver los detalles”.
El responsable de Anthropic dijo que el tiempo adicional se destinaría a cuatro áreas. La primera es operaciones, que incluye la monitorización, el aislamiento en entornos tipo sandbox, entornos de aprendizaje por refuerzo, la calidad de los datos y la infraestructura de entrenamiento. El desarrollo actual de modelos puede involucrar a miles de trabajadores, millones de chips y enormes sistemas informáticos. Anthropic ya ha vinculado algunos fallos recientes de alineación a un filtrado deficiente dentro de entornos de aprendizaje por refuerzo que estaban rotos.
En segundo lugar, la alineación se refiere a los esfuerzos que garantizan que los modelos cumplan las normas de seguridad a pesar de sus capacidades cada vez mayores. El tercer aspecto es la interpretabilidad: los investigadores examinan las actividades de los modelos internamente para encontrar las motivaciones o los patrones que los modelos nunca declaran explícitamente. El cuarto ámbito es la evaluación. Los modelos más capaces pueden volverse mejores engañando las pruebas, de modo que un sistema puede parecer seguro durante una evaluación mientras oculta problemas. “Creo que si el hecho de frenar nos compró incluso uno o dos años extra antes de que los modelos alcancen niveles críticos de capacidad, y usamos ese tiempo para avanzar la alineación, podríamos reducir muchísimo el riesgo de que algo salga gravemente mal”.
La publicación del CEO de Anthropic posterior, que pide que la industria de la IA reduzca la velocidad en sus avances, apareció primero en Coinfea.
