SciConBench 用滚动新综述面板区分模型真实进步与数据泄露

manoelribeiro · x · 2026-10-07

该基准在固定核心集与每月滚动更新的新发表综述面板上评测模型,回答三个问题:模型合成科学结论的能力是否在进步、能否合成最新结论、进步是真实还是靠数据泄露。方法可扩展到健康以外的其他科学领域。

所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →