两年后重跑 200 对临床分诊测试,谷歌 OpenAI Anthropic 都上场
zakkohane · x · 2026-07-23
作者把两年前做过的一项临床分诊实验又重复了一遍,样本还是同样的 200 对患者。
- 他让来自 Google、OpenAI 和 Anthropic 的前沿模型判断两名模拟患者谁该先看。
- 这个设置刻意保持简单:同一任务、同一批配对,只是隔两年再做一次,看看模型判断是否变化。
- 后续线程进一步比较了 2024 到 2026 的表现,以及闭源/开源模型的可重复性。
所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→
「模型」频道最新
- 用户称 Anthropic 200 欧元订阅频繁降级到更弱 Opus — evilsocket · 2026-07-23
- 阿里巴巴发布 2.4T 参数的 Qwen 3.8 开放权重模型 — testingcatalog · 2026-07-23
- Qwen 3.8 Max preview 在 Three.js 场景任务上更快 — testingcatalog · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23
- Qwen3.8-Max 在 3D Web 前端上被评更强于 Kimi K3 — cedric_chee · 2026-07-23