SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337

SciConBench 被 NeurIPS 2026 接收,论文已上 arXiv。该基准评估 AI 在健康领域综合科学结论的能力,核心发现是:最强模型的 factual F1 仅 0.337(综合科学结论任务),结论合成任务上最好的 GPT-6.1 Sol 也只达到 41.1,多数模型集中在约 0.30–0.33;同时 61.1%–90% 的 AI 合成结论至少含一条与专家撰写的 Cochrane 综述相矛盾的事实。团队计划每两个月运行一轮评测并公开寻求 API 与资金支持。

已确认

为什么重要

2026-10-07 ~ 2026-10-07 · 10 条相关

一手来源