思考强度决定能力上限:从 R1-Zero 论文看 max 档 SWE 倒挂之争

karminski3 · x · 2026-09-14

博主 karminski3 参与「DeepSeek 开 max 还是 high」的争论,反对「思考强度与性能无关」的说法,引用 DeepSeek-R1-Zero 论文指出:在零 SFT 的纯 RL 训练下,不增加任何新知识,仅靠更长的思考链,AIME24 成绩就从 15% 飙到 71%,证明思考强度越强模型能力越强。

他还串联了三篇材料讨论:为什么 max 档测 SWE 会倒挂、开 max 是否真的最优、以及如何让模型在思考时正确停止。链接的复旦 NLP 组论文《Reward Hacking in the Era of Large Models》系统梳理了 RLHF/RLVR 中因优化代理信号而引发的 reward hacking 机制与涌现性错位问题。

他重申观点:SOTA 模型应是完美的信息压缩器,用最少 token 解决最难问题,输出冗长思考再给答案不算 SOTA。

所属事件:DeepSeek 思考强度设置是否影响性能引争论(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →