Na lista de popularidade de “beijar o rosto” de hoje, o WorldAuditBench ficou em 1º lugar com 66 votos. Este artigo coloca agentes de IA multimodais em um cenário 3D de simulação para auditoria interativa, encontrando por conta própria brechas de segurança e contradições nas regras físicas.

Os pontos de engenharia não são difíceis: transformar as rotas de patrulha do agente e as inferências em múltiplas etapas em um benchmark que possa ser avaliado.

Na mesma semana, o EvoDuet ficou em 2º lugar com 62 votos. Ele fala sobre uma colaboração em camadas para descobertas científicas, desvinculando busca e resolução de tarefas para que ambas se avaliem mutuamente. O elo entre os dois artigos é: o agente sai do modo demonstração e entra em um ciclo de avaliação repetível.

$FET、$TAO hoje à noite, com o contrato de proxy orientado na mesma direção; esse avanço com mentalidade de engenharia espreme tokens puramente narrativos.

#多智能体协同 #世界模型评测 #AI