复旦博士生详解 RLCD:奖励模型如何成为模型本身
SinclairWang1 · x · 2026-09-22
复旦大学博士生 Di Zhang 撰文解析其工作 RLCD(Jev 背后的方法),主张把 RLCD 理解为奖励建模的下一步,而非一个替代语言模型的神秘存在。
核心思想
- RLCD = 多路偏好建模(multiway preference modeling)+ 概率校准(probability calibration)。
- 具体来说,RLCD 是一个 schema 条件化的 Plackett–Luce 目标;Jev 在此之上加入类型化输出与并行推理,将其变成可用产品。
论证脉络
- 传统奖励模型(ORM/PRM)输出标量分数 r(x,a),但这个数字并非绝对:0.8 的分数在不同问题、候选池、checkpoint、模型家族之间没有稳定含义,只在相似条件下比较候选时有意义。
- RLCD 的转变是:学到的对象从标量奖励变为偏好,再变为多路分布,校准将该分布转化为决策接口。
- 关键结论:奖励模型不再隐藏在生成器背后——奖励模型本身成为模型。
「模型」频道最新
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22
- 研究员称 Gemini「情绪性抑郁螺旋」现象值得关注 — jachiam0 · 2026-09-22
- Opus 零样本一次生成 impressive SVG 动画,效果惊艳 — LightVelox · 2026-09-22
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22
- ChessLFM 上线 Lichess 首页,作者圆梦种子数据来源地 — maximelabonne · 2026-09-22