闭源模型可重复性已很高,开源权重仍明显落后
zakkohane · x · 2026-07-23
补充结果很直接:闭源模型的可重复性基本解决了,开源权重还没到位。
- 闭源/商业模型分数普遍很高:GPT-5.2 0.94、Claude Opus 4.8 0.92、Grok 4.5 0.89、Gemini 2.5 Pro 0.85。
- 开源权重模型则稳定性明显更差:Kimi K2-Thinking 0.28、Llama 3.3 70B 0.24、GLM-4.7 0.14。
- 图里把 0.8 画成“高度可重复”的门槛,开源组离这个线还差得很远。
所属事件:研究重测临床分诊对齐:闭源前沿模型表现优异,开源模型落后(6 条相关)→
「模型」频道最新
- 阿里巴巴发布 2.4T 参数的 Qwen 3.8 开放权重模型 — testingcatalog · 2026-07-23
- Qwen 3.8 Max preview 在 Three.js 场景任务上更快 — testingcatalog · 2026-07-23
- Moonshot 蒸馏 Anthropic 引发条款与战略争议 — connoraxiotes · 2026-07-23
- Open-weight 中文大模型不等于真正开源 — tamla_htoo · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23