Qwen3.8-27B 默认 xhigh 推理:多花 8 倍 token 只换来噪音级提升

DerTomsn · reddit · 2026-09-10

作者发现 Qwen3.8-27B 的 chat template 默认 reasoningeffort=xhigh(三档最高),且该变量不在服务端报告中,用户很难察觉。他在单台 M5 Max、同一量化版本上实测三档:

作者附了思考预算实验:12k 上限可把耗时砍半且不截断输出。成本数据可靠,质量结论建议作为方向自行验证。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →