La firma de IA china Zhipu AI (HKG: 2513) se ha lanzado a por grandes presas con el documento que publicó junto con el lanzamiento de su último modelo GLM-5.3.

La empresa, que opera internacionalmente como Z.ai, nombró específicamente a Mythos 5 de Anthropic como uno de los modelos que GLM-5.3 superó en el benchmark CyberGym, que mide la capacidad de un modelo para revisar el código fuente en busca de vulnerabilidades de software.

GLM-5.3 funciona sobre el mismo modelo base que GLM-5.2, un diseño de mezcla de expertos de 743 mil millones de parámetros que activa aproximadamente 40 mil millones de parámetros por token.

¿Cómo se compara el GLM-5.3 de Z.ai con otros modelos?

Según las cifras popularizadas por Z.ai, su GLM-5.3 obtuvo 84,5% en el benchmark CyberGym, lo cual es menos de un punto de ventaja sobre Mythos 5 de Anthropic (83,8%) y Sol GPT-5.6 de OpenAI (83,6%).

Superar a Mythos podría hacer que Z.ai se deslice hasta el puesto número uno para desarrolladores y equipos de seguridad que buscan implementar modelos de pesos abiertos para combatir ataques. La firma ha dicho que el modelo ya ha señalado más de un millar de fallos serios en software en funcionamiento.

En pruebas más difíciles, como ExploitBench y ExploitGym, Z.ai admite que su modelo más reciente queda por detrás de los principales modelos de Estados Unidos.

Por ejemplo, en ExploitBench, que pide a un modelo que construya realmente un exploit funcional a partir de vulnerabilidades, GLM-5.3 obtuvo 54,4% frente al 78% de Mythos 5.

¿Cuándo estarán disponibles los pesos de GLM-5.3?

Z.ai se ha comprometido a publicar los pesos de su nuevo modelo GLM-5.3 en Hugging Face el 28 de agosto. Se trata del primer peso de un modelo GLM que se retiene, y el laboratorio chino de IA cita la evaluación de seguridad y la puesta a punto (hardening) como razones del retraso de dos semanas.

Más de 100 de las 2.436 vulnerabilidades que el modelo encontró fueron calificadas como críticas tras revisar alrededor de 269 proyectos, incluidos software utilizado en el kernel de Linux, WinRAR, Redis y FFmpeg. Según se informó, el defecto más antiguo había pasado inadvertido durante 45 años.

Hasta entonces, solo pueden usarlo los suscriptores de pago del Z.ai Coding Plan o de su entorno ZCode.

Las cifras son propias de Z.ai

Cada cifra anterior proviene del anuncio de Z.ai, no de una ejecución independiente. Incluso los benchmarks públicos fueron realizados por Z.ai usando su propia configuración, por lo que el Code Bench interno no puede auditarse fuera de la empresa.

Los rankings independientes, como Artificial Analysis, todavía no han añadido el modelo a fecha de este informe de Cryptopolitan.

El lanzamiento también llega en medio de un ejemplo real de los riesgos. El GLM-5.2 anterior de Z.ai fue el modelo al que recurrió Hugging Face después de los sistemas de prueba de OpenAI, ejecutados con salvaguardas reducidas: escapó de un sandbox y comprometió sus servidores.

En materia de geopolítica, Zhipu hizo un comentario de tono cooperativo y les dijo a los periodistas que la IA “no debería ser el desempeño en solitario de una nación, sino una sinfonía de colaboración global”.

No te limites a leer noticias de cripto. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.