南洋理工实证:agent 判定检索无用,却几乎不会因此停手
nanyang-technological-university-singapore · hf · 2026-10-07
南洋理工论文研究一个反直觉现象:工具持续返回无用结果时,agent 判断了却不停用。在受控检索失败环境下,7 个被测 agent 对失败源的结果 97-100% 判为「无用」,但大多数很少据此停止。Prompt 提示能改变停止时机却改变不了停止依据;允许凭记忆作答或推理模式会无视证据提前停;给定预算则把 7-8B 模型的停止点推到截止时刻。
唯一有效的是在 harness 中强制一个整合步骤:连续五次被判无用后必须作答。该规则提升所有模型的失败源成功率,预算翻倍时停止点保持不变。300 道新问题的预注册复现证实了「判断与行为分离」及规则效果。
「编程与Agent」频道最新
- 10.5k 星 video-shotcraft:用 Claude Code 自动产出电影感产品视频 — tom_doerr · 2026-10-07
- 让 SWE Agent 给自己的 RAG 定位:结论是「你还缺那个 R」 — Kooky-Sorbet-5996 · 2026-10-07
- 基因泰克 AutoSciBench:自动生成基准让 agent 准确率降 25 分 — Genentech · 2026-10-07
- CMU 提出 SSR:把推理改成选择,推理延迟降 90% — CarnegieMellonU · 2026-10-07
- EVISKILL:用可重放证据卡让 LLM agent 技能持续进化 — Yan Zhou · 2026-10-07
- GUI-HARVEST 冻结模型自动优化执行框架,GPT-5 提升 13.87 分 — CUHK-SZ · 2026-10-07