研究揭示 LLM 审查临床记录只查“有没有”不查“缺没缺”
sbulaev · hn · 2026-09-02
一篇 arXiv 论文指出,用 LLM 审查 AI 生成的临床记录时存在“遗漏盲区”:LLM 评审员擅长验证记录中存在的内容是否正确,却系统性地无法发现缺失的关键信息——比如漏掉的症状、未记录的用药或被省略的异常指标。论文将这种现象称为 omission blindness(遗漏盲视),对医疗场景有直接安全含义:如果用 LLM 做 AI 临床记录的质量把关,最危险的不是写错,而是漏写,而这恰恰是当前评审器最弱的一环。作者给出了针对遗漏检测的评测框架与失败案例分析。
「研究」频道最新
- 新基准 ObviousBench:人类全对送分题,GPT-Luna 拿下两冠 — adamallcock · 2026-09-23
- 用「假设-实验-证伪」循环框定自动化科学的可行路径 — burny_tech · 2026-09-23
- 范畴论深度学习尚无实用架构,几何深度学习才是先例 — burny_tech · 2026-09-23
- Voxiferi 开源 VoxWall:为 LLM 训练数据装一道「入站防火墙」 — CackleRooster · 2026-09-23
- 研究者称模型深度被严重低估,是缺失的 scaling 轴 — madhavsinghal_ · 2026-09-23
- 斯坦福研讨会:AI Agent 如何撰写研究论文 — jonc101x · 2026-09-23