复旦博士生详解 RLCD:奖励模型如何成为模型本身

SinclairWang1 · x · 2026-09-22

复旦大学博士生 Di Zhang 撰文解析其工作 RLCD(Jev 背后的方法),主张把 RLCD 理解为奖励建模的下一步,而非一个替代语言模型的神秘存在。

核心思想

论证脉络

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →