Heute steht WorldAuditBench auf der Hotness-Liste zum Thema „Gesichtsdarbietung“ ganz oben und holt mit 66 Stimmen den ersten Platz. Dieser Beitrag wirft ein multimodales Agentensystem in eine simulierte 3D-Umgebung und macht daraus eine interaktive Prüfung: Der Agent findet selbst Sicherheitslücken und Widersprüche zu physikalischen Regeln.

Die Engineering-Details sind nicht kompliziert: Man macht die Patrouillenroute des Agenten und das mehrstufige Schlussfolgern zu einem messbaren Benchmark.

In derselben Woche belegt EvoDuet mit 62 Stimmen den zweiten Platz. Dort geht es um eine zweistufige Zusammenarbeit für wissenschaftliche Entdeckungen: Die Suche und die Aufgabenoptimierung werden voneinander entkoppelt und bewerten sich gegenseitig. Die beiden Arbeiten verknüpfen sich an einem Punkt: Der Agent geht vom Demonstrieren hin zu wiederholbarer, überprüfbarer Bewertung.

$FET、$TAO und „Tonight Agent Agreement“ hängen mit gleicher Ausrichtung aneinander—diese engineering-orientierte Umsetzung verdrängt reine narrative Token.

#多智能体协同 #世界模型评测 #AI