从 ReAct 到 Constitutional AI:反馈信号越便宜越模糊的阶梯
le_james94 · x · 2026-09-16
该推文(上下文为过程奖励模型与验证器讨论串)把第 4 讲概括为一个「更弱信号的阶梯」:环境回答(ReAct)、测试套件回答(RLEF)、成文文档回答(Constitutional AI)。循环结构从不改变,但每一级信号获取更便宜、行动时也更模糊。上一级还提到:过程奖励模型给每个推理步骤打分,训练一个曾需 80 万人标注;Math-Shepherd 用 rollout 替代标注者——一步好不好取决于模型能否从它仍到达正确答案,把 GSM8K 从 77.9% 提升到 84.1%。
所属事件:斯坦福 CS329A 课程热传:验证器与自我改进 Agent 成核心议题(9 条相关)→
「研究」频道最新
- 前 OpenAI 高管新公司用 1300 张 H200 训出 Neon,材料分析胜 GPT-6 Astra — LiamFedus · 2026-09-16
- 谷歌 5390 万参数扩散模型让查询扩展提速 12-20 倍 — imjustnewatai · 2026-09-16
- 斯坦福论文:50 个样本即可评测音频大模型,HUMANS 基准开源 — stanfordnlp · 2026-09-16
- AI agents 耗百亿 token 攻坚 60 年未解的删除信道容量问题 — DimitrisPapail · 2026-09-16
- 学者呼吁顶会鼓励 AI 审计论文,壮大第三方审计生态 — dhadfieldmenell · 2026-09-16
- 贝叶斯优化研究者 Ruth Chew 离开 DSO 赴华盛顿大学读博 — PangWeiKoh · 2026-09-16