为什么分数更高的模型,实际用起来反而更弱
robleclerc · x · 2026-07-28
被引用的长段讨论了一个常见但反直觉的现象:benchmark 排名更高的模型,未必就是实际使用里更“聪明”的模型。
核心论点是,大模型在强化学习(RL)阶段往往更难、更贵,因此更新迭代速度可能更慢:
- 小一点的模型更容易、也更便宜地吸收新数据、新环境和新的 RL 计算;
- 大模型虽然基座更强,但每一轮 RL 的成本更高,递进式提升可能更慢;
- 于是会出现一种局面:某个模型在测试集上继续领先,但另一个模型在真实交互中已经显得更强。
回复者进一步补了一层类比:现实中也常见“很会提炼别人的知识、很会 testmaxing,但不一定是最高智力层级”的人。
「模型」频道最新
- Kimi K3 在 OpenRouter 上吞吐升至 49 tok/s — cedric_chee · 2026-07-28
- Kimi K3 以 2.8T 参数、百万上下文和 0.30 美元输入价上线 — togethercompute · 2026-07-28
- Together AI 上线月之暗面 Kimi K3,支持百万上下文和工具调用 — togethercompute · 2026-07-28
- k3 没改 RL 算法,工具调用步骤却几乎和分数 1:1 对齐 — stochasticchasm · 2026-07-28
- DeepInfra 上线 Claude Opus 5,支持 100 万上下文和新价格 — gharik · 2026-07-28
- Kimi K3 登上 OpenRouter,第三方供应商开始抢接入 — scaling01 · 2026-07-28