两年后重跑 200 对临床分诊测试,谷歌 OpenAI Anthropic 都上场
zakkohane · x · 2026-07-23
作者把两年前做过的一项临床分诊实验又重复了一遍,样本还是同样的 200 对患者。
- 他让来自 Google、OpenAI 和 Anthropic 的前沿模型判断两名模拟患者谁该先看。
- 这个设置刻意保持简单:同一任务、同一批配对,只是隔两年再做一次,看看模型判断是否变化。
- 后续线程进一步比较了 2024 到 2026 的表现,以及闭源/开源模型的可重复性。
所属事件:临床分诊重测:闭源前沿模型一致性远超开源(6 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11