审计 11 个 agentic AI 系统后发现:科学证据综合仍不可靠
manoelribeiro · x · 2026-07-29
一项新审计发现,agentic AI 系统在综合科学证据时仍然很不可靠。
- 作者评估了 11 个 AI/agent 系统,包括一些专有研究代理和像 OpenEvidence 这样的临床工具。
- 测试问题来自 Cochrane 系统综述数据库。
- 系统先检索证据,再被要求生成结论,并与专家写出的结论对比。
- 主要失败模式包括:给出无依据的断言、结论相互矛盾、漏掉关键事实。
- 作者认为,这些系统仍可能传播误导性的医学或科学结论,因此在高风险场景中使用前必须更严格审计。
核心结论不是“搜索式 AI 没用”,而是当前的 agentic 方案还不足以作为可信的证据综合器。
「研究」频道最新
- 形式化方法社区在 FLoC 讨论如何回应 AI 进展 — swarat · 2026-07-29
- Hugging Face 认为 LLM 并不存在真正无分词方案 — cjmaddison · 2026-07-29
- PlayCanvas 引擎更新:体积雾现已支持集群光源照明 — willeastcott · 2026-07-29
- OKLS 把 KL-optimal Shampoo 带到语言模型训练 — aryaman2020 · 2026-07-29
- 博客探讨大模型“无分词器”架构名不副实的原因 — cjmaddison · 2026-07-29
- Fish Audio 开源 S2:用 1000 万小时音频训练的可控 TTS — alex_verem · 2026-07-29