前沿模型医学结论合成进步有限,最高 factual F1 仅 41.1

manoelribeiro · x · 2026-10-07

前沿模型在医学结论合成任务上进步甚微:最好的 GPT-6.1 Sol 也只达到 41.1 factual F1,多数模型集中在约 0.30–0.33,说明医疗领域的结论合成仍是难题。

所属事件:SciConBench 入选 NeurIPS:最强 AI 医学结论合成 F1 仅 0.337(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →