CAMEL让奖励模型先快判再反思

jiqizhixin · x · 2026-07-20

NUS 和 TikTok 研究者提出 CAMEL:一种用于奖励模型的置信度门控反思框架。

它先用单 token 做一次快速偏好判断,只在低置信度样本上触发“反思”流程;反思部分结合强化学习和 counterfactual prefixes 来提升判断质量。作者报告该方法平均准确率达到 82.9%,比此前最佳提升 3.2%,而且用 14B 参数就能超过一些 70B 模型,在准确率与效率上都取得新的 Pareto frontier。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →