RL with Confidence Margin 论文:让置信度逐步追踪推理正确性

EliasEskin · x · 2026-09-30

一篇入选 COLM 2026 的论文介绍「RL with Confidence Margin」方法。作者指出 TypeSafe 的 Jev(用 RLCD 训练)已能为快速结构化决策给出校准概率,而他们的工作更进一步:聚焦推理过程本身,研究模型的置信度能否随推理轨迹逐步展开、一步步追踪每一步的正确性。论文详情以推文线程形式给出。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →