Flash de Notícias de IA com Ritmo Dinâmico: o Terminal-Bench lançou a versão 4.0, recalibrando o tempo, a CPU e a memória quando o agente executa tarefas, e corrigindo 19 tarefas. Ele removeu 8 tarefas com saturação, negação, soluções divulgadas abertamente ou problemas de qualidade. O tempo máximo de execução para todas as tarefas foi padronizado em 8 horas, principalmente para reduzir interferência de timeouts e questões ambientais no desempenho.No ranking mais recente, Opus 5 + Claude Code ocupa o primeiro lugar com 51,8%, seguido por Fable 5 com 44,5%. GLM-5.3 + Claude Code marcou 41,8%, garantindo a terceira colocação, superando GPT-5.6 Sol + Codex em 37,3%. Entre os três primeiros, GLM-5.3 é o único modelo que não é da Anthropic.No Terminal-Bench 3.0, o GLM-5.3 ficou em quarto lugar com 32,4%, atrás do GPT-5.6 Sol (34,6%); na versão 4.0, o GLM-5.3 subiu para o terceiro lugar, abrindo vantagem sobre Sol por 4,5 pontos percentuais na virada.
