Mistral 新论文:特权价值函数让 LLM 强化学习 critic 更强
jm_alexia · x · 2026-08-19
Mistral AI 联合 Mila、蒙特利尔大学发布论文 Le Critique: Privileged Value Functions for LLM Reinforcement Learning,针对 LLM 强化学习中价值函数被严重低估的问题提出两项改进:
- 特权价值函数(PVF):让 critic 使用策略看不到的隐藏上下文(参考答案、验证器评分规则、同组其他采样与奖励),生成更有信息量的 token 级 RL 信号,在不向策略泄露信息的前提下降低策略梯度方差。
- TETHER:不再在 group 均值基线与 value 基线之间二选一,而是根据 value 函数的可靠性,在留一法 group 均值与学习到的 value 基线之间自适应插值——critic 越准,贡献越大。
论文与代码均已开源。
「研究」频道最新
- Schmidhuber 组 agent 综述:自我改进多改脚手架,权重更新罕见且易塌缩 — maier_ak · 2026-09-22
- 用 autoresearch 优化非 LLM 模型:错误率减半,成本仅 DeepSeek 的 1/7 — davernow · 2026-09-22
- 先在 Lean 里证完主结果,再让 AI 生成练习册补 LaTeX 证明 — jessi_cata · 2026-09-22
- Schmidhuber 晒 1987 年论文:我做递归自我改进比 ChatGPT 早了几十年 — SchmidhuberAI · 2026-09-22
- 腾讯 GameHorizon:5000 小时 AAA 游戏视频评测 47 个模型的游戏能力 — tencent · 2026-09-22
- NUS 提出 GAM:用 3D 指引作底座,机器人操作成功率显著领先 — NationalUniversityofSingapore · 2026-09-22