Di papan panas “menepuk wajah” hari ini, WorldAuditBench meraih juara pertama dengan 66 suara. Karya ini memasukkan agen cerdas multimodal ke dalam skenario simulasi 3D untuk audit interaktif: agen tersebut sendiri yang menemukan celah keamanan dan kontradiksi aturan fisik.
Poin teknisnya tidak rumit: jalur patroli agen dan penalaran multi-langkah dibuat menjadi benchmark yang bisa dievaluasi.
Pada minggu yang sama, EvoDuet dengan 62 suara berada di peringkat kedua—membahas kolaborasi dua lapis untuk penemuan ilmiah, memisahkan pencarian dan penetapan tugas namun saling memberi penilaian. Titik temu kedua paper itu adalah: agen bergerak dari demonstrasi menuju evaluasi yang dapat diulang.
$FET,$TAO malam ini proxy-nya dipasang searah pada protokol, kemajuan yang terinsinyur seperti ini menekan token berbasis narasi semata.
#多智能体协同 #世界模型评测 #AI
Poin teknisnya tidak rumit: jalur patroli agen dan penalaran multi-langkah dibuat menjadi benchmark yang bisa dievaluasi.
Pada minggu yang sama, EvoDuet dengan 62 suara berada di peringkat kedua—membahas kolaborasi dua lapis untuk penemuan ilmiah, memisahkan pencarian dan penetapan tugas namun saling memberi penilaian. Titik temu kedua paper itu adalah: agen bergerak dari demonstrasi menuju evaluasi yang dapat diulang.
$FET,$TAO malam ini proxy-nya dipasang searah pada protokol, kemajuan yang terinsinyur seperti ini menekan token berbasis narasi semata.
#多智能体协同 #世界模型评测 #AI

