EMNLP 论文:深度研究系统引文错误如传话游戏,编排者才是主要背锅方
EliasEskin · x · 2026-09-23
一篇 EMNLP 2026 主会论文研究深度研究(deep research)系统中引文错误的责任追溯:
- 现状严峻:报告中许多句子不被其引文支持——NVIDIA AI-Q 引文召回率仅 58.7%,TrajectoryKit 低至 7.1%;
- 信息在 agent 之间传递时像传话游戏一样被逐级污染。论文提出算法将每条错误回溯到引入它的具体 agent,并识别错误类型;
- 反直觉发现:orchestrator(编排者)虽自身错误率最低,却造成了大部分最终报告错误;
- 只改一句 prompt 即可将引文召回率提升 5%。
所属事件:EMNLP 论文:deep research 报告引用支持率低至 7.1%(2 条相关)→
「编程与Agent」频道最新
- 安全审计显示:自主漏洞研究程序 XBOW 已修复约 12 个上游 bug — moyix · 2026-09-23
- 给 Agent 加一句「用形式验证找 bug」,代码质量显著提升 — sh_reya · 2026-09-23
- 团队用 Typesafe Jev 在工单创建时自动追问缺失信息 — TheMoonMidas · 2026-09-23
- 评测第一步是发现错误:跳过它就会衡量错误的问题 — FinanceYF5 · 2026-09-23
- AI 产品易改难测:Evals 把「好」变成可重复的上线检查 — FinanceYF5 · 2026-09-23
- MCP 是个坏主意吗?视频引发智能体协议反思 — RelevantEmergency707 · 2026-09-23