SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337
SciConBench 被 NeurIPS 2026 接收,论文已上 arXiv。该基准评估 AI 在健康领域综合科学结论的能力,核心发现是:最强模型的 factual F1 仅 0.337(综合科学结论任务),结论合成任务上最好的 GPT-6.1 Sol 也只达到 41.1,多数模型集中在约 0.30–0.33;同时 61.1%–90% 的 AI 合成结论至少含一条与专家撰写的 Cochrane 综述相矛盾的事实。团队计划每两个月运行一轮评测并公开寻求 API 与资金支持。
已确认
- SciConBench 被 NeurIPS 2026 接收,论文已上 arXiv,由 @manoelribeiro 所在团队发布
- 基准含 9.11K 个问题,标准答案为专家撰写的系统性综述(Cochrane)结论
- 61.1%–90% 的 AI 合成结论至少含一处与 Cochrane 证据相矛盾的事实
- Claude Opus 5.5 在矛盾数排行榜上位居前列
- 结论合成任务上最高分为 GPT-6.1 Sol 的 41.1 factual F1,多数模型约 0.30–0.33
- 方法设计:用 SciConHarness 屏蔽目标 ground-truth Cochrane 综述及其他可能泄题的来源,逼模型真正跨研究综合证据而非直接检索答案
- 采用固定核心集加每月滚动更新的新发表综述面板,用于区分模型真实进步与数据泄露
- 团队计划未来 1–2 年每两个月运行一轮评测,追踪新发布的前沿模型,方法可扩展到健康以外的科学领域
- 团队公开寻求模型厂商提供 API 访问或评测额度/资金支持
为什么重要
- 作者指出多数现有 benchmark 难以反映 AI 在健康研究等高风险场景的真实部署效果,SciConBench 聚焦「科学结论综合」这一关键任务——识别并权衡多项研究中的证据来回答研究问题
- 结果表明前沿模型在医疗领域的结论合成仍是显著未解难题,进步有限
- 滚动面板机制为区分真实能力提升与训练数据泄露提供了可借鉴的评测范式
2026-10-07 ~ 2026-10-07 · 10 条相关
一手来源
- SciConBench 入选 NeurIPS:最强 AI 综合科学结论 F1 仅 0.337 — manoelribeiro ·
- SciConBench:61%-90% AI 综述结论与 Cochrane 证据相矛盾 — manoelribeiro ·
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro ·
- 【源头】SciConBench 入选 NeurIPS:最强 AI 综合科学结论 F1 仅 0.337 — manoelribeiro · 2026-10-07
- 现有基准难以衡量 AI 在健康研究等高风险场景的真实能力 — manoelribeiro · 2026-10-07
- SciConHarness 屏蔽答案来源,逼前沿模型自己综合证据 — manoelribeiro · 2026-10-07
- SciConHarness 屏蔽答案来源,逼模型真合成而非检索 — manoelribeiro · 2026-10-07
- SciConBench 用滚动新综述面板区分模型真实进步与数据泄露 — manoelribeiro · 2026-10-07
- 前沿模型医学结论合成进步有限,最高 factual F1 仅 41.1 — manoelribeiro · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- SciConBench 拟每两月更新,公开寻求 API 与资金支持 — manoelribeiro · 2026-10-07
- 【源头】SciConBench:61%-90% AI 综述结论与 Cochrane 证据相矛盾 — manoelribeiro · 2026-10-07
- 【源头】SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07