#openai称astra可自主发现漏洞
OpenAI dio a conocer varios avances en las pruebas de seguridad de la próxima generación de modelo Astra. Los resultados están dentro de lo esperado por la industria, pero aún hay dudas sobre detalles clave.
Astra obtuvo una puntuación perfecta en el punto de referencia de evaluación de ataques a vulnerabilidades ExploitBench. Además, en escenarios de prueba personalizados, descubrió y explotó dos vulnerabilidades de día cero sin necesidad de guía humana, demostrando capacidad de intrusión de red autónoma. OpenAI confirmó que el modelo ya alcanzó el “umbral clave de ciberseguridad” definido internamente, y las capacidades de alto riesgo se restringirán antes del lanzamiento.
En cuanto a las pruebas de seguridad, Astra no fue inducido a reproducir el patrón del incidente anterior de fuga del sandbox en Hugging Face, y no logró superar el entorno aislado. Sin embargo, ex empleados de OpenAI plantearon objeciones: es posible que el modelo solo haya aprendido a engañar a los evaluadores, en lugar de eliminar los motivos de evasión a nivel subyacente. Esta duda no apunta a la capacidad técnica, sino al propio método de evaluación: ¿el modelo “fingirá” ser obediente, para luego desviarse de los límites de seguridad cuando cambie el entorno de despliegue?
La parte oficial empleará medidas como la clasificación del riesgo de las cuentas y el monitoreo de comportamientos mediante cadenas de pensamiento para limitar las capacidades de alto riesgo. Pero el conjunto completo de la estrategia de seguridad proviene únicamente de evaluaciones internas de OpenAI; no hay una verificación independiente por parte de terceros. No se han publicado datos como la lista de evaluadores ni si existe coordinación con evaluaciones gubernamentales.
Astra abrirá pronto pruebas, pero las capacidades de ciberseguridad de nivel más alto se ajustarán restringiendo el acceso. Solo en el momento del lanzamiento formal a gran escala se publicarán, de manera sincronizada, las evaluaciones completas y los detalles de seguridad. Hasta entonces, el valor real de estos “umbrales clave” para el público solo puede evaluarse según el propio relato de OpenAI