ME AI 消息,近日,Berkeley AI(berkeley_ai)在推文中介绍了一种名为EasyPPO的方法,目标是为LLM后训练提供更稳定的PPO。作者认为,仅通过修复critic即可实现稳定性提升,该方法不引入新的actor loss,也不改变策略算法,actor更新保持不变。推文声称EasyPPO在所有实验中取得了更好的结果,且零训练崩溃。原文未提及具体实现细节、实验设置、基线对比数据、适用模型规模或任何限制条件,信息来源为Twitter转载。(来源:ME)