DualStake 解决研究 Agent 过度自信,精度无损
_reachsumit · x · 2026-09-02
论文 DualStake 提出一种针对 Deep Research Agents 的双路径置信度校准方法。研究发现,检索步骤后的“证据置信度”(E-Conf) 比生成答案后的“答案置信度”(A-Conf) 更能反映不确定性。该方法通过在检索和生成两个阶段引入基于置信度的边际裁剪奖励,联合校准 E-Conf 和 A-Conf,在不牺牲回答准确率的情况下显著降低了过度自信。在 Qwen 系列模型及 8 个 QA 基准测试中表现一致,代码已开源。
「编程与Agent」频道最新
- 开发者厌倦频繁切换模型,更倾向稳定改进的 Claude Code — ivan_bezdomny · 2026-09-02
- Claude-BugHunter:83个技能+681个披露模式的开源漏洞猎手包 — tom_doerr · 2026-09-02
- 单提示词生成完整《模拟人生》级生活模拟器 — CurieuxExplorer · 2026-09-02
- 质疑过度验证:Coding Agent 的运行时状态问题 — klahmestiyo · 2026-09-02
- Nous Research 发布 Portal 平台整合 Agent 生态 — Teknium · 2026-09-02
- 用 Q-learning 训练 GDevelop 平台游戏 AI — tristanbob · 2026-09-02