13 个 AI 模型玩问诊游戏:195 次全诊断正确,安全表现才见分晓

radeon2000 · reddit · 2026-10-04

一位澳大利亚全科医生培训生自建问诊游戏 doctorfoo,让 13 个 AI 模型坐上诊室位子,在 5 个免费病例上各问诊 3 次,共 195 次咨询,只能通过工具(问话、查体、开检查、开药、转诊、下诊断)行动,由与人类玩家完全相同的评分代码打分。

关键结果

局限:作者强调这是「游戏的 benchmark」而非医疗能力评测,样本小(每模型 15 次)、病例由作者自写、患者与评分器均为 8B 小模型且有已知错误。代码、病例与全部 195 份问诊记录均已开源(crook-bench)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →