SciConHarness 屏蔽答案来源,逼模型真合成而非检索

manoelribeiro · x · 2026-10-07

作者介绍 SciConBench 的核心机制:用 SciConHarness 屏蔽目标 ground-truth Cochrane 综述及其他能泄露答案的来源,确保模型必须真正合成答案而非直接查到。基准持续追踪三个问题:合成能力是否在进步、能否处理最新结论、进步是否源于泄露。

所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →