让模型自己调 thinking 档位:自适应 reasoning effort 初试提速明显

HeDo88TH · reddit · 2026-09-06

针对近期 Qwen 3.8 27B thinking levels 的争论,作者提出与其手动选 thinking 档位,不如改造 harness 让 LLM 自己决定何时升降推理力度。

做法:系统根据成功/失败 streak 在 low 与 xhigh 之间自动调节,日志显示规则如——「连续成功→降到 low」「有意义的失败→升到 medium」「机械性步骤→降档」「进入 RECOVER/DEBUG 阶段→升档」。作者称初步观感是解题速度大幅提升,但还没有可靠的质量评估数据。

他也在征求同类实践者,并纠结如何量化质量(比如跑 GPQA Diamond 前后对比)。

所属事件:开发者实测自适应推理强度:让模型自己调 thinking 档位(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →