Google, OpenAI y Anthropic respaldan un organismo de estándares de seguridad para la IA que se acerca a su creación formal, y el exsocio de Andreessen Horowitz, Sriram Krishnan, es un candidato temprano para liderarlo.

Puntos clave

  • Google, OpenAI y Anthropic respaldan un organismo de estándares de seguridad para la IA que se acerca a su creación formal

  • El exsocio de Andreessen Horowitz, Sriram Krishnan, es un candidato temprano para liderar el organismo

  • Los tres laboratorios han convergido en pruebas de mejora de armas biológicas, capacidad cibernética y replicación autónoma

  • La credibilidad dependería del acceso a los pesos del modelo y los datos de entrenamiento, la estructura de financiación y la independencia

Según un informe, los tres laboratorios publican cada uno marcos de seguridad para el futuro y documentos de autoevaluación que describen cómo prueban los modelos para detectar un uso indebido catastrófico antes de su lanzamiento. Cada uno redacta su propia “política de escalado responsable” y, en gran medida, califica su propia tarea, porque ninguna agencia gubernamental ha finalizado estándares técnicos vinculantes para modelos en este nivel de capacidad.

Un organismo compartido reemplazaría tres manuales de reglas en competencia por un solo árbitro al que los laboratorios responderán.

Este mes, Anthropic publicó una investigación que muestra que Claude puede calcular una amplitud de dispersión de nueve lazos en la teoría N=4 de super-Yang-Mills. Ese resultado es una prueba de esfuerzo del razonamiento bruto, no un punto de referencia de seguridad, y plantea la pregunta aparte de qué mediría realmente un punto de referencia así.

La publicación técnica abierta de este tipo sigue siendo la excepción en toda la industria.

Por qué Google, OpenAI y Anthropic compartirían un manual de reglas

Los equipos de seguridad de Google, OpenAI y Anthropic han convergido durante los últimos dos años en categorías de pruebas que incluyen mejoras de armas biológicas, capacidad cibernética y replicación autónoma, incluso mientras publican por separado. Un solo proceso de auditoría podría formalizar esa convergencia, reducir el trabajo de cumplimiento duplicado y darles a los reguladores un punto de referencia en lugar de tres versiones inconsistentes.

También abordaría las críticas de que las afirmaciones de seguridad son documentos de marketing y no auditorías independientes.

También leer: La última actualización de caché de GPT-6 de OpenAI agrega controles de costos y latencia

El camino desigual desde los compromisos individuales hasta la supervisión compartida

Los laboratorios frontier ya han intentado la autorregulación antes. OpenAI, Anthropic y Google DeepMind firmaron cada una compromisos voluntarios de IA con la Casa Blanca en 2023 y luego se desviaron con fuerza en la implementación, y algunos omitieron por completo los red teaming con terceros. Los reguladores en Washington y Bruselas han citado repetidamente la divergencia en la autoevaluación como prueba de que los marcos voluntarios no fueron suficientes.

¿Qué haría que este organismo sea realmente una realidad?

Para Google, OpenAI y Anthropic, la credibilidad dependería de si el organismo obtiene acceso tipo citación a los pesos del modelo y los datos de entrenamiento o si solo ve los resúmenes cercanos al marketing que los laboratorios ya publican.

Un nombramiento de director ejecutivo señala seriedad, pero la estructura de financiación y la independencia de los tres laboratorios fundadores determinarán si funciona como un regulador en espera o como una asociación comercial con mejor imagen de marca.

Leer siguiente: Los inversores de Alibaba tienen hasta el 5 de octubre para liderar la demanda contra Anthropic