研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后
研究者时隔两年重新运行了一项临床分诊对齐实验,使用相同的200对患者样本,评估了来自Google、OpenAI和Anthropic等厂商的前沿模型在判断就诊优先级上的一致性。
已确认
闭源商业模型在临床分诊的可重复性上已达到很高水平,其中GPT-5.2达到0.94,Claude Opus 4.8为0.92,Grok 4.5为0.89,Gemini也取得了高分。相比之下,开源权重模型明显落后:Llama 3.3 70B的整体一致性(κ)仅为0.03(简单题0.13,难题甚至为负数),GLM-4.7为0.2。此外,Grok 4.5在未对齐状态下的κ达到0.63,在统计上与Gemini和Opus的表现接近。
为什么重要
该研究证实了闭源模型在医疗分诊等严谨任务上的可靠性与可重复性已基本解决,但开源模型仍有巨大差距。同时,in-context alignment(上下文对齐)技术对前沿模型在难题上的表现有显著拉升作用(例如Grok 4.5在难题对上从0.28获得提升),而在简单题上的提升相对有限。
2026-07-23 ~ 2026-07-23 · 6 条相关
一手来源
- 两年后重跑 200 对临床分诊测试,谷歌 OpenAI Anthropic 都上场 — zakkohane ·
- 闭源模型可重复性已很高,开源权重仍明显落后 — zakkohane ·
- 开源权重模型在分诊测试中明显落后,Llama 3.3 70B 仅接近零分 — zakkohane ·
- 【源头】两年后重跑 200 对临床分诊测试,谷歌 OpenAI Anthropic 都上场 — zakkohane · 2026-07-23
- 【源头】闭源模型可重复性已很高,开源权重仍明显落后 — zakkohane · 2026-07-23
- 【源头】开源权重模型在分诊测试中明显落后,Llama 3.3 70B 仅接近零分 — zakkohane · 2026-07-23
- in-context alignment 主要拉升了前沿模型的难题表现 — zakkohane · 2026-07-23
- 研究称 Grok 4.5 在对齐测试中追平 Gemini 和 Opus — zakkohane · 2026-07-23
- Grok 4.5 在临床分诊对齐测试中拿到最高分 — zakkohane · 2026-07-23