医疗 LLM 评测陷「基准过期」困境,新研究推活基准解法

davidjhwu · x · 2026-10-06

研究者指出医疗 LLM 基准测试的一大痛点:基准数据很快过时。其团队发布新预印本,为电子健康病历(EHR)信息检索构建「活基准」(A Living Benchmark),可持续评估不断演进的模型能否可靠检索临床医生所需信息。一个有趣发现是「遗漏」(omission)是常见失败模式,另一团队在其 NOHARM 预印本中也观察到同样现象。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →