DualStake 解决研究 Agent 过度自信,精度无损

_reachsumit · x · 2026-09-02

论文 DualStake 提出一种针对 Deep Research Agents 的双路径置信度校准方法。研究发现,检索步骤后的“证据置信度”(E-Conf) 比生成答案后的“答案置信度”(A-Conf) 更能反映不确定性。该方法通过在检索和生成两个阶段引入基于置信度的边际裁剪奖励,联合校准 E-Conf 和 A-Conf,在不牺牲回答准确率的情况下显著降低了过度自信。在 Qwen 系列模型及 8 个 QA 基准测试中表现一致,代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →