Hôm nay, trong bảng mức độ “hot” ôm mặt, WorldAuditBench giành vị trí đầu với 66 phiếu. Bài này đưa tác nhân đa phương thức vào bối cảnh mô phỏng 3D để làm kiểm toán tương tác: tự tìm lỗ hổng bảo mật và mâu thuẫn với các quy tắc vật lý.

Điểm kỹ thuật không quá phức tạp: biến lộ trình tuần tra của tác nhân và chuỗi suy luận nhiều bước thành một chuẩn mực có thể đánh giá.

Trong cùng tuần, EvoDuet với 62 phiếu đứng thứ hai, nói về sự phối hợp hai lớp dựa trên phát hiện khoa học—tách rời việc tìm kiếm và bài toán nhiệm vụ rồi để chúng tự đánh giá lẫn nhau. Hai điểm giao của hai bài là: tác nhân đi từ trình diễn tiến vào môi trường kiểm tra có thể lặp lại.

$FET、$TAO tối nay đang treo theo hướng hợp đồng ủy quyền, tiến độ kỹ thuật kiểu này đang chèn ép các token chỉ thiên về kể chuyện.

#多智能体协同 #世界模型评测 #AI