同团队再强调:更大模型与更强推理都修不好医疗事实核查
mdredze · x · 2026-10-09
Mark Dredze 在其 NeurIPS GenAI4Health Oral 论文基础上补充核心结论:医疗领域的「检索后验证」事实核查以系统性的方式失败——而更大的模型、更多推理算力、更好的信息来源和医疗领域微调,都无法修复这些问题。
这是对同一条研究线的浓缩表述,与该组入选 Oral 的失败分类研究相互呼应。
所属事件:研究称医疗AI事实核查系统性失败,大模型与微调均无解(3 条相关)→
「研究」频道最新
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09
- Ofir Press 点名 ExcelBench:编码 agent 评测该瞄准这种任务规模 — OfirPress · 2026-10-09