思考强度决定能力上限:从 R1-Zero 论文看 max 档 SWE 倒挂之争
karminski3 · x · 2026-09-14
博主 karminski3 参与「DeepSeek 开 max 还是 high」的争论,反对「思考强度与性能无关」的说法,引用 DeepSeek-R1-Zero 论文指出:在零 SFT 的纯 RL 训练下,不增加任何新知识,仅靠更长的思考链,AIME24 成绩就从 15% 飙到 71%,证明思考强度越强模型能力越强。
他还串联了三篇材料讨论:为什么 max 档测 SWE 会倒挂、开 max 是否真的最优、以及如何让模型在思考时正确停止。链接的复旦 NLP 组论文《Reward Hacking in the Era of Large Models》系统梳理了 RLHF/RLVR 中因优化代理信号而引发的 reward hacking 机制与涌现性错位问题。
他重申观点:SOTA 模型应是完美的信息压缩器,用最少 token 解决最难问题,输出冗长思考再给答案不算 SOTA。
所属事件:DeepSeek 思考强度设置是否影响性能引争论(3 条相关)→
「模型」频道最新
- X 网友称传阅的 Astra/Fable 参数远小于 10 万亿,模型规模已难对应能力 — teortaxesTex · 2026-09-14
- 记者实测:免费 ChatGPT 花 13 分钟破解十年悬而未决的骰子难题 — Chris_Armstrong · 2026-09-14
- David Bellamy 澄清实验用的是开源 375B 模型 K2 Horizon — JeremyNguyenPhD · 2026-09-14
- Reddit 用户因「网络滥用」警告申诉被 OpenAI 一小时驳回 — TheBeaconCrafter · 2026-09-14
- Swift-Qwen3.8-27b 冲上 Hugging Face 热榜,主打高效推理省 token — ukisai · 2026-09-14
- GPT-6 Astra 3D 实测:先作曲再配器,表现力碾压同级竞品 — paw_lean · 2026-09-14