Flash de noticias de IA con ritmo dinámico: Terminal-Bench ha lanzado la versión 4.0, recalibrando el tiempo, la CPU y la memoria cuando el agente realiza tareas, y corrigiendo 19 tareas. Eliminó 8 tareas con saturación, negación, soluciones divulgadas abiertamente o problemas de calidad. El tiempo máximo de ejecución para todas las tareas se estandarizó en 8 horas, principalmente para reducir la interferencia de los timeouts y problemas del entorno en el rendimiento.En el último ranking, Opus 5 + Claude Code ocupa el primer lugar con 51,8%, seguido por Fable 5 con 44,5%. GLM-5.3 + Claude Code obtuvo 41,8%, reclamando el tercer puesto y superando a GPT-5.6 Sol + Codex, que logró 37,3%. Entre los tres primeros, GLM-5.3 es el único modelo que no proviene de Anthropic.En Terminal-Bench 3.0, GLM-5.3 ocupó el cuarto lugar con 32,4%, quedando por detrás de GPT-5.6 Sol, con 34,6%; con la versión 4.0, GLM-5.3 ha subido al tercer puesto, liderando a Sol por 4,5 puntos porcentuales en esta ronda.