研究 Agent 只记录引用还不够:被拒来源也应可审查
Entire_Mark8010 · reddit · 2026-09-15
作者提出:现在可以核查研究 agent 引用了什么,却难以审查它排除了什么、为什么排除。文中举例:一个审查临床疗效研究的 agent 最终报告合理、引用可溯源,但两项阴性结果研究缺失——真正原因是解析失败(陌生的表格格式导致抽取为空),流水线误判为「无相关数据」,解析故障在外部看来就像刻意筛选。
类比 GKE 的 GPU dutycycle 指标:只能说明 GPU 在处理,不能说明计算推进了任务;引用列表同理,只显示进入答案的来源。引用 12 篇、拒绝 30 篇的 agent,与引用 12 篇、拒绝 3 篇的 agent,最终参考文献可以一模一样,审阅者无从判断其组装过程。
作者建议:保留被拒来源及其排除原因的记录(指标不兼容、列缺失、抽取失败、来源冲突等),这些记录本身也需被抽查。文末提问:评估预算有限时,该验证已引用声明,还是抽样检查被拒来源?作者披露与 Apodex 合作,其 Task Board 可视化任务拆解与子 agent 活动,Statement Review 核查关键声明。
「编程与Agent」频道最新
- Claude Code 自动批准有风险,作者整理 Agent 沙箱选型地图 — minchoi · 2026-09-15
- 写代码成本趋零后,程序员都成了「产品工程师」 — rseroter · 2026-09-15
- 工程负责人:shadcn/lint 正是我想要的设计系统 linter,准备迁移 — shadcn · 2026-09-15
- 一个 prompt 生成整款 3D 射击游戏,ASTRA 编排 Thrixel 出资产 — RanaHanocka · 2026-09-15
- 同一需求三模型实测:0.5 美元的腾讯 Hy3 方案胜过 4 美元的 Claude — tejasghutukade · 2026-09-15
- Stripe 公开征集意见:用 AI Agent 经营业务的用户想要什么功能 — jeff_weinstein · 2026-09-15