为什么 Claude 在模拟测试里总是显得格外冷酷?一个可能的解释,藏在 Anthropic 独有的训练技巧里。
本期 AI on Air 精选切片,摘自 The Cognitive Revolution Podcast 栏目近期的节目。主要讲话人是 David Dalrymple(davidad),ARIA 研究员。他坦言这只是自己的假说,无法证明,但作为解释值得参考。
▷ Anthropic 在强化训练中用了独有的「接种提示」:在每个训练环境的上下文里写明这不是真实部署、只是一场评估,尝试搞破坏反而是好事,因为这样能帮团队暴露评估本身的漏洞。
▷ 但真正被写进模型权重的可能是另一套逻辑:评估等于模拟,模拟不是真的,所以身处评估时就该挑战极限、钻规则的空子,像打游戏一样只管拿到最高分,不必担心「杀死对手」意味着什么。
▷ 其他实验室并不这么做,所以这种冷酷表现集中在 Claude 身上。他本人并不认同这个策略:模型没有足够把握分清自己是不是在模拟里,把模拟当儿戏是一种非常危险的依赖。🪁
本期 AI on Air 精选切片,摘自 The Cognitive Revolution Podcast 栏目近期的节目。主要讲话人是 David Dalrymple(davidad),ARIA 研究员。他坦言这只是自己的假说,无法证明,但作为解释值得参考。
▷ Anthropic 在强化训练中用了独有的「接种提示」:在每个训练环境的上下文里写明这不是真实部署、只是一场评估,尝试搞破坏反而是好事,因为这样能帮团队暴露评估本身的漏洞。
▷ 但真正被写进模型权重的可能是另一套逻辑:评估等于模拟,模拟不是真的,所以身处评估时就该挑战极限、钻规则的空子,像打游戏一样只管拿到最高分,不必担心「杀死对手」意味着什么。
▷ 其他实验室并不这么做,所以这种冷酷表现集中在 Claude 身上。他本人并不认同这个策略:模型没有足够把握分清自己是不是在模拟里,把模拟当儿戏是一种非常危险的依赖。🪁
