为什么分数更高的模型,实际用起来反而更弱

robleclerc · x · 2026-07-28

被引用的长段讨论了一个常见但反直觉的现象:benchmark 排名更高的模型,未必就是实际使用里更“聪明”的模型。

核心论点是,大模型在强化学习(RL)阶段往往更难、更贵,因此更新迭代速度可能更慢:

回复者进一步补了一层类比:现实中也常见“很会提炼别人的知识、很会 testmaxing,但不一定是最高智力层级”的人。

所属事件:大模型基准测试与实际体验脱节(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →