多智能体跑失败后,谁在哪步出错,现在被做成了可量化归因任务。PSU 和 Duke 等建了 Who&When:127 个失败日志,人工标注责任智能体、决定性错误步骤和原因。测试三种自动化方法,最好也只认出责任智能体约 53.5%,定位错误步骤 14.2%。所以能测,但离准还远。