开源权重模型在分诊测试中明显落后,Llama 3.3 70B 仅接近零分
zakkohane · x · 2026-07-23
同一项临床分诊研究里,开源权重模型和闭源前沿模型的差距也很明显。
- Llama 3.3 70B 的整体 κ 只有 0.03,在简单题对上是 0.13,难题对甚至是负数。
- GLM-4.7 为 0.24,Kimi K2-Thinking 为 0.35。
- 作者的结论是:这批开源权重模型里最好的表现,大致只相当于2024 年闭源前沿的水平。
所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→
「模型」频道最新
- 阿里巴巴发布 2.4T 参数的 Qwen 3.8 开放权重模型 — testingcatalog · 2026-07-23
- Qwen 3.8 Max preview 在 Three.js 场景任务上更快 — testingcatalog · 2026-07-23
- Moonshot 蒸馏 Anthropic 引发条款与战略争议 — connoraxiotes · 2026-07-23
- Open-weight 中文大模型不等于真正开源 — tamla_htoo · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23