DEX 最佳摘要:大模型能揪出医生大量诊断错误,但差距仍大
mdredze · x · 2026-10-09
Ahmed Hassoon 的研究获 DEX26 最佳摘要(人民选择奖):构建跨横截面基准,评估 LLM 修正医生诊断错误的能力。
- 顶级 LLM 能发现相当数量的医生诊断错误
- 但仍存在明显差距,距可靠辅助临床诊断还有距离
「研究」频道最新
- Inherit-MAS:借鉴生物遗传的多智能体系统测试时进化,省 34.6% token — Songtao Wei · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09