动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误
manoelribeiro · x · 2026-10-07
作者发布持续评测前沿模型「科学结论合成」能力的动态基准 SciConBench 的关键发现:
- 61.1%–90% 的 AI 合成结论至少含一处与专家撰写的 Cochrane 综述相矛盾的事实,其中 Claude Opus 5.5 矛盾率最高。
- 医学结论合成依然很难:最好的模型 GPT-6.1 Sol 仅达到 41.1 factual F1,多数模型集中在 0.30–0.33。
- 基准用 SciConHarness 屏蔽目标 Cochrane 综述等可泄露答案的来源,逼模型真正「合成」而非检索;同时用固定核心集 + 每月滚动的新综述面板,区分真实进步与数据泄露。
- 计划未来 1–2 年每两个月更新一次排行榜,正在寻求 API 额度与资金支持。
所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→
「模型」频道最新
- 开发者吐槽 token 计费:像计费小时一样激励扭曲 — amankhan · 2026-10-07
- JevBench 拆分榜单:开源模型与 API 服务商将分开排名 — airesearch12 · 2026-10-07
- 热评:评估网络攻防能力时激活参数量基本不重要,关键在 RL 环境覆盖 — teortaxesTex · 2026-10-07
- Decagon 发布 Voice 3:双工架构让语音客服 agent 边说边听 — Scobleizer · 2026-10-07
- 决策模型 JEV-9B 登上 Hugging Face 趋势榜,基于 Qwen3.5 微调 — autotrust · 2026-10-07
- 「Astra 暂停综合征」刷屏:steering 或致模型沉默,OpenAI 有解法 — thursdai_pod · 2026-10-07