误导性证据基准下,深度研究 agent 准确率暴跌 66–88 点
_reachsumit · x · 2026-07-21
论文 **DRNoise: Benchmarking Deep Research Agents in Misleading Evidence Environments** 研究深度研究型 agent 在“误导性证据”环境中的表现,发现它们常会直接被一份错误文档带偏,而不是去核对多份记录。 - 在这种场景下,准确率会下降 **66–88 个百分点**。 - 暴露出的核心问题是:agent 在给出答案前,缺少稳定的证据交叉核验能力。 - 这说明当前 deep research 系统在噪声或对抗性证据下仍然很脆弱。
「编程与Agent」频道最新
- LangChain AI 开源 open_deep_research 深度研究代理项目 — langchain-ai · 2026-07-21
- 一个让 coding agent 先给结论的 ADHD 输出技能 — ayghri · 2026-07-21
- 一组面向 CAD、机器人和硬件设计的智能体技能 — earthtojake · 2026-07-21
- 给 pi coding agent 做的一个 Web UI — agegr · 2026-07-21
- Outlines 用结构化输出把 LLM 约束在轨道上 — dottxt-ai · 2026-07-21
- Claude Code 可以接入 TradingView Desktop 做图表分析了 — tradesdontlie · 2026-07-21