医疗 LLM 评测陷「基准过期」困境,新研究推活基准解法
davidjhwu · x · 2026-10-06
研究者指出医疗 LLM 基准测试的一大痛点:基准数据很快过时。其团队发布新预印本,为电子健康病历(EHR)信息检索构建「活基准」(A Living Benchmark),可持续评估不断演进的模型能否可靠检索临床医生所需信息。一个有趣发现是「遗漏」(omission)是常见失败模式,另一团队在其 NOHARM 预印本中也观察到同样现象。
「研究」频道最新
- 首个 3B/8B 规模连续扩散语言模型:低步数推理质量保持更优 — ArashVahdat · 2026-10-06
- AggAgent 亮相 COLM:把并行轨迹当环境,聚合长程智能体经验 — xiye_nlp · 2026-10-06
- 新论文:LLM 口头表述概率与内部概率高度耦合 — sineadwilliamso · 2026-10-06
- Nature子刊新论文:单细胞模型「跑不赢基线」是度量问题 — BoWang87 · 2026-10-06
- 250 余位专家共识:含中美在内的国际机构授权最能有效降低 AI 灾难风险 — robseamans · 2026-10-06
- 自适应深度停机规则负结果:损失更差、选的深度反而更多 — BlackHC · 2026-10-06