Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析
lateinteraction · x · 2026-10-02
Souradip Chakrabarti(转发自 lateinteraction)探讨近期热议的 Jev 现象是否意味着模型在暗中学习一个 Value function:
- 将 Jev 放入 System 1/System 2 决策框架:模型可以直接选出答案"A"而不确定 A 正确与否,这一区分决定了 agent 何时快速行动、何时切换到更深的推理,校准(calibration)是切换时机的关键。
- 指出 RL 中最大化期望奖励并不能保证得到校准良好的概率,这是为什么 RL 训练的模型可能不"知道自己不知道"。
- 提出在 agent 任务中预测最终任务成功与否,本质上是预测一个熟悉的 RL 量——Q 函数;价值预测或许能构建一个校准的 System 1,这可能是 Jev 背后的机制之一。
「编程与Agent」频道最新
- 开源维护者苦诉:AI 生成的 PR 泛滥,复现与理解全被跳过 — Abhishekcur · 2026-10-02
- 开源项目 OpenTag 冲上 GitHub 第 13,把 Agent 接入 Slack 与 Teams 值班 — FinanceYF5 · 2026-10-02
- OpenAI 发布 Dots 后,开源版 OpenDots 追上:自托管 AI 同事来了 — FinanceYF5 · 2026-10-02
- 机器人抓取改用 Opus 写的代码控制,视觉对位精准插入后盖 — ihorbeaver · 2026-10-02
- 幂等性与去重有什么区别?一张图讲清分布式系统常见混淆点 — _jaydeepkarale · 2026-10-02
- 开源 CodexBar 上架菜单栏:22k 星,一屏看尽各家 AI 额度 — lxfater · 2026-10-02