1100 任务医疗安全基准 NOHARM:随机对照检验医生与 AI 协作
davidjhwu · x · 2026-09-21
斯坦福团队在 ANCO 泌尿肿瘤研讨会上获最佳海报奖,并发布 preprint《First, do NOHARM》:一个医疗 AI 安全基准与随机对照研究。
- NOHARM(Numerous Options Harm Assessment for Risk in Medicine)是 1100 个任务的基准,覆盖从初级诊疗到专科会诊的真实病例
- 核心目标是量化 LLM 在临床咨询中产生「潜在有害错误」的频率与严重程度——此前医疗 AI 的临床安全性画像一直模糊
- 同时开展了一项医生与 AI 组队的随机对照研究,后续工作在构建 AI 安全肿瘤学基准
- 作者称研究让他更体会到肿瘤科医生的价值所在
这是少有的把「LLM 会不会害人」做成可测量基准+RCT 的严肃工作,医疗 AI 落地安全性的重要参考。
所属事件:斯坦福NOHARM医疗AI安全基准研究获ANCO最佳海报(2 条相关)→
「漫话AGI」频道最新
- 「懂了原理就别谈意识」:神经网络与 LLM 的意识之争互怼 — cephaloform · 2026-09-21
- 菲尔兹奖得主 Villani 态度反转:被 OpenAI 解法震撼 — zetalyrae · 2026-09-21
- 陶哲轩 Caltech 演讲:AI 攻克数学猜想,但我们可以慢一点 — rohanpaul_ai · 2026-09-21
- 「AI 文字无法编辑」才是真正的 AI 写作破绽 — kfountou · 2026-09-21
- Shopify CEO 后悔强推全员 AI:员工互扔「slop 手雷」 — jonerp · 2026-09-21
- 手语社区借 Boyer 之问:谁有权采集我们的语言训练 AI — danielleboyerr · 2026-09-21