CAMEL让奖励模型先快判再反思
jiqizhixin · x · 2026-07-20
NUS 和 TikTok 研究者提出 CAMEL:一种用于奖励模型的置信度门控反思框架。
它先用单 token 做一次快速偏好判断,只在低置信度样本上触发“反思”流程;反思部分结合强化学习和 counterfactual prefixes 来提升判断质量。作者报告该方法平均准确率达到 82.9%,比此前最佳提升 3.2%,而且用 14B 参数就能超过一些 70B 模型,在准确率与效率上都取得新的 Pareto frontier。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22