15个前沿LLM医疗测试:对抗压力下94%正确答案失效

davidmanheim · x · 2026-09-06

作者在讨论一项针对15个前沿大模型的医疗可靠性研究,并追问:医生本身就面临药厂销售、保险规则等多种对抗性压力导致诊疗质量下降,AI 反而不受这些压力影响——这些人类对抗性风险是否比 AI 自身的对抗风险更严重?研究背景是:模型在 MedQA 等静态考试上准确率超 80%,但在自适应对抗压力下中位数 94% 的正确答案失效。

所属事件:前沿LLM医疗可靠性引热议:对抗压力与不作为伦理成焦点(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →