为何 2026 年还留非思考模式?CoT 监控与性能双双要推理
scaling01 · x · 2026-09-17
一位研究者在与 @maksymandr 的讨论中谈到:如今基础模型即便不推理也比 GPT-4/GPT-4.5 强得多,纯看延迟和研究价值仍有意义;但现在已经「有点蠢」的是完全不用推理——哪怕是低档推理也能大幅提升性能。对方补充了两个原因:OpenAI 与 Anthropic 都相当依赖 CoT 监控,模型至少需要输出一些思维链才能被监控;而且 2026 年还保留一个完全不思考、直接作答的模型本身就显得奇怪。
「模型」频道最新
- 演讲者还在调侃 ChatGPT 幻觉,作者反问:你配上下文和深度研究了吗? — zebird0 · 2026-09-17
- 旗舰更贵未必更值:GPT-6 Astra 与 Claude Fable 5.1 单任务成本翻倍 — arena · 2026-09-17
- 让模型「成为 null」:GPT-5.2 与 Claude 均输出零字节并停止 — rayanpal_ · 2026-09-17
- 免费重置成亏损策略?Codex 用户已破 2000 万,重置或停发至 DevDay — brandon_galang · 2026-09-17
- GLM 5.3 上线 Brave Nightly,表现接近 GPT 5.6 Sol 与 Grok 4.6 — gnukeith · 2026-09-17
- 实测打脸:GPT 5.6 Luna 智力追平 5.5,性价比碾压 — nickbaumann_ · 2026-09-17