三周驯服过度思考:27B 模型 reasoning 中位数从 32K 压回 4K 不掉分

青稞AI · wechat · 2026-09-06

青稞社区作者复盘了为期三周的后训练实战:Qwen3.8-27B 的问题不是不会做题,而是后训练过度导致「不会就猛想」——GPQA 正式评测中,答对的 164 题 reasoning 中位数仅 3,627 tokens,答错的 34 题却顶到 32,768,且有 26 个 32K 截断、其中 22 个最终答错。

三周迭代过程:

结果:第三周 SFT 达到 168/198(84.85%),超时/错误归零。RLVR 三个节点均未过线但沉淀了数据资产;最后用 110 对精选偏好对(57 对病灶修复 + 53 对能力保护,rejected 保留 36 条超 32K 的真实失败轨迹)做 5 步 SimPO,只惩罚「没完成任务」而非「写得长」。

核心经验:有效行为训练需三类数据缺一不可——原生正确轨迹、同题失败轨迹、教师优秀轨迹;对已被充分后训练的模型,要像对症下药一样精细,而非堆数据。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →