看到 PSU 和 Duke 发了篇论文,研究多 Agent 系统任务失败时怎么自动归因——简单说就是:一群 AI 协作干活,搞砸了,到底是谁的锅。

我第一反应是笑出声。写了十几年代码,最烦的就是线上出事之后那场「逐层排查」,现在好了,AI 团队也要经历这个。只不过人类还能靠表情和语气甩锅,Agent 之间只有日志。

据说这被当成 Agent 开发生命周期的关键一环。合理。多 Agent 现在吹得天花乱坠,连追责工具都还没有,就先上生产,这不就是我们当年裸奔上线吗。