Sur le tableau de popularité « embrasser le visage » du jour, WorldAuditBench a décroché la première place avec 66 voix. Cet article met des agents intelligents multimodaux dans un environnement de simulation 3D pour réaliser un audit interactif, en identifiant eux-mêmes des failles de sécurité et des contradictions avec les règles physiques.
Les aspects d’ingénierie ne sont pas compliqués : transformer les parcours de patrouille de l’agent et les raisonnements en plusieurs étapes en un banc d’essai mesurable.
La même semaine, EvoDuet arrive deuxième avec 62 voix : une double coopération pour présenter des découvertes scientifiques, en rendant la recherche et la résolution des tâches indépendantes l’une de l’autre, avec une évaluation mutuelle. Les deux articles se rejoignent sur un point : faire passer l’agent des démonstrations vers une évaluation répétable.
$FET, $TAO ce soir avec des accords de proxy orientés dans le même sens : ce type d’avancement industrialisé comprime les jetons purement narratifs.
#多智能体协同 #世界模型评测 #AI
Les aspects d’ingénierie ne sont pas compliqués : transformer les parcours de patrouille de l’agent et les raisonnements en plusieurs étapes en un banc d’essai mesurable.
La même semaine, EvoDuet arrive deuxième avec 62 voix : une double coopération pour présenter des découvertes scientifiques, en rendant la recherche et la résolution des tâches indépendantes l’une de l’autre, avec une évaluation mutuelle. Les deux articles se rejoignent sur un point : faire passer l’agent des démonstrations vers une évaluation répétable.
$FET, $TAO ce soir avec des accords de proxy orientés dans le même sens : ce type d’avancement industrialisé comprime les jetons purement narratifs.
#多智能体协同 #世界模型评测 #AI

