ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令
GregKamradt · x · 2026-10-02
ARC Prize 团队通过 Baseten 测试 Qwen3.8-27B 时发现一个意外现象:模型自带的 chat template 会按 reasoningeffort 档位注入不同的系统指令,而非简单扩大思考预算——
- low:指示「保持思考简短聚焦」
- xhigh:指示「仔细思考、验证关键假设、考虑可行替代方案」
- medium:不添加任何指令(思考仍开启)
团队认为这或许能解释 medium 档得分偏低:这些设置改变的是模型被指示如何解题的方式,而不只是给了更大的思考预算。GregKamradt 转发表示「这出乎意料」,并感谢 Baseten 协助验证他们没有搞错。模板文件已在 Hugging Face 公开。
「模型」频道最新
- 传 Anthropic 新模型下周二发布,内部称智能「超凡」 — imjustnewatai · 2026-10-02
- VAmoS Pro 语音基准:Grok 任务最强,GPT-Live 响应最快 — davlanade · 2026-10-02
- 网友观察:Opus 5.5 频繁使用「himbo」一词,系历代 Claude 首见 — repligate · 2026-10-02
- Ramp 数据显示企业 AI 支出首次下降,开源模型占比不足 5% — PaulYacoubian · 2026-10-02
- 神秘新模型 Fledge Alpha 被扒:多项线索指向 Thinking Machines Lab — cephaloform · 2026-10-02
- Ivo 开源合同模型 Sage:从 70% 提到 91%,成本低于竞品 — ibab · 2026-10-02