现有基准难以衡量 AI 在健康研究等高风险场景的真实能力

manoelribeiro · x · 2026-10-07

作者指出多数 benchmark 并不能准确反映 AI 在健康研究等高风险场景中的实际部署效果,因此团队聚焦「科学结论综合」这一关键任务:让 AI 识别并权衡多项研究中的证据来回答研究问题,并据此构建了 SciConBench 评测。

所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →