从 ReAct 到 Constitutional AI:反馈信号越便宜越模糊的阶梯

le_james94 · x · 2026-09-16

该推文(上下文为过程奖励模型与验证器讨论串)把第 4 讲概括为一个「更弱信号的阶梯」:环境回答(ReAct)、测试套件回答(RLEF)、成文文档回答(Constitutional AI)。循环结构从不改变,但每一级信号获取更便宜、行动时也更模糊。上一级还提到:过程奖励模型给每个推理步骤打分,训练一个曾需 80 万人标注;Math-Shepherd 用 rollout 替代标注者——一步好不好取决于模型能否从它仍到达正确答案,把 GSM8K 从 77.9% 提升到 84.1%。

所属事件:斯坦福 CS329A 课程热传:验证器与自我改进 Agent 成核心议题(9 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →