EMNLP 论文:deep research 报告引用支持率低至 7.1%
一篇入选 EMNLP 2026 主会的论文测量了 deep research 报告中句子与其引用来源的匹配度,发现许多句子并不被引用支持,在 NVIDIA AI-Q 数据集上 recall 低至 7.1%。论文还追溯了引文错误的责任归属,指出类似「传话游戏」的错误传播中,编排(orchestration)环节才是主要问题来源,而非末端模型本身。
2026-09-23 ~ 2026-09-23 · 2 条相关
- EMNLP 论文:deep research 报告引用支持率低至 7.1% — mohitban47 · 2026-09-23
- EMNLP 论文:深度研究系统引文错误如传话游戏,编排者才是主要背锅方 — EliasEskin · 2026-09-23