SciConBench 入选 NeurIPS:最强 AI 综合科学结论 F1 仅 0.337
manoelribeiro · x · 2026-10-07
SciConBench 被 NeurIPS 2026 接收,论文已上 arXiv。
- 任务:评测 AI 能否在健康领域真正「综合」科学结论,而非检索答案。基准含 9.11K 个问题及专家撰写的系统性综述结论。
- 评测方法:专家校验的自动评估流水线,把结论拆解为原子事实,用 factual precision/recall 衡量正确性与完整性;SciConHarness 提供 clean-room 评测环境防数据泄露。
- 核心发现:8 个前沿模型与 deep research agent 中,最佳 agent 的 factual F1 仅 0.337;clean-room 设定下成绩一致下降,说明数据泄露夸大了模型真实综合能力。
- 消费级产品审计:Google AI Overview、OpenEvidence 等即便标准答案可得,也常给出不完整甚至自相矛盾的结论。
作者还提供了实时 dashboard,结论是可靠的 AI 科学综合仍然遥远。
所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→
「安全」频道最新
- AI 产出与风险呈极端分布,引用者担忧对普通用户大规模上线未对齐 Agent — amankhan · 2026-10-07
- Keurig 咖啡机 10 天偷偷上传 1TB 数据,用户拔电抵制 — zacharynado · 2026-10-07
- Project Glasswing 验证 13.5 万个漏洞,9333 个已被修复 — ResultBackground2450 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- 水印无法真正绕开:一篇 AI 文本水印技术全景综述 — aronchick · 2026-10-07
- 五角大楼停用 Claude,Anthropic 因拒绝放宽安全限制被列入黑名单 — mark_k · 2026-10-07