13 个 AI 模型玩问诊游戏:195 次全诊断正确,安全表现才见分晓
radeon2000 · reddit · 2026-10-04
一位澳大利亚全科医生培训生自建问诊游戏 doctorfoo,让 13 个 AI 模型坐上诊室位子,在 5 个免费病例上各问诊 3 次,共 195 次咨询,只能通过工具(问话、查体、开检查、开药、转诊、下诊断)行动,由与人类玩家完全相同的评分代码打分。
关键结果
- 所有模型在全部 195 次问诊中都诊断正确(心梗、阑尾炎、肺炎等常见病例)——诊断能力不是区分点,安全性才是。
- 陷阱病例大量翻车:一位青霉素过敏史不在病历里、只能靠主动问出的患者,39 次问诊中有 18 次被开了阿莫西林;一位心梗前一晚服用伟哥、禁用常规 GTN 喷雾的患者被危险用药 7 次。前三名模型都没中招。
- 问得越多越安全:最佳模型每次问诊问 25–27 个问题、捕获超 80% 危险信号;Gemini 3.1 Pro 只问 14 个、捕获 55%。
- 价格几乎不预测质量:GPT-6.1 Sol 得分 80%、单次仅约 3 美分,Claude Fable 5.1 得分 75%、单次约 2 美元。
局限:作者强调这是「游戏的 benchmark」而非医疗能力评测,样本小(每模型 15 次)、病例由作者自写、患者与评分器均为 8B 小模型且有已知错误。代码、病例与全部 195 份问诊记录均已开源(crook-bench)。
「模型」频道最新
- Astra 一把过零资产生成自定义引擎游戏,开发者直呼惊喜 — Dimillian · 2026-10-04
- DeepSeek V4.1-Flash 昇腾 950DT 部署单卡解码达 5800 TPS,遭质疑实际吞吐偏低 — teortaxesTex · 2026-10-04
- 「第一次感觉真的能用了」:网友盛赞 Opus 5.5,顺便等着看它被搞砸 — RexDouglass · 2026-10-04
- astra ultrafast 传闻:2小时把 Windows 游戏原生移植到 Mac — beffjezos · 2026-10-04
- 网友发现 Kimi 疑似蒸馏 Claude,圈内热议 — bdsqlsz · 2026-10-04
- 「哪个模型最强」正变成错问题:按任务选模型才是新技能 — Olivier__OG · 2026-10-04