三周驯服过度思考:27B 模型 reasoning 中位数从 32K 压回 4K 不掉分
青稞AI · wechat · 2026-09-06
青稞社区作者复盘了为期三周的后训练实战:Qwen3.8-27B 的问题不是不会做题,而是后训练过度导致「不会就猛想」——GPQA 正式评测中,答对的 164 题 reasoning 中位数仅 3,627 tokens,答错的 34 题却顶到 32,768,且有 26 个 32K 截断、其中 22 个最终答错。
三周迭代过程:
- 第一周:小剂量 SFT(32–130 条)几乎无效,数据没把「病灶」说清楚。
- 第二周:加大 SFT 剂量见效但代价惨重——思考量降六成,GPQA 却从 166/198 掉到 148/198;RLVR 只拉回 158,长尾反而更差。
- 第三周:转向精细化数据——保留 894 条模型原生正确轨迹护基座,176 条同题病灶轨迹交给 Grok4.6/Opus5/K3 修复,835 条独立教师轨迹由 GPT-5.6Sol 复核,最终冻结 1,905 条。8K 以上长轨迹仅占 14.2% 却贡献 47.2% 的 reasoning tokens,避免模型「遇难题只写几行」。
结果:第三周 SFT 达到 168/198(84.85%),超时/错误归零。RLVR 三个节点均未过线但沉淀了数据资产;最后用 110 对精选偏好对(57 对病灶修复 + 53 对能力保护,rejected 保留 36 条超 32K 的真实失败轨迹)做 5 步 SimPO,只惩罚「没完成任务」而非「写得长」。
核心经验:有效行为训练需三类数据缺一不可——原生正确轨迹、同题失败轨迹、教师优秀轨迹;对已被充分后训练的模型,要像对症下药一样精细,而非堆数据。
「模型」频道最新
- Artificial Analysis 更新榜单方法,小幅修订致排名剧变引质疑 — solyarisoftware · 2026-09-06
- Astra 饱和空间推理基准,博主直呼「LLM 视觉已解决」 — lukaszkaiser · 2026-09-06
- Nvidia 携手 CrowdStrike 打造网络安全 AI 模型 — israelavila · 2026-09-06
- Plus 用户多模型分工工作流:ASTRA 只当架构师省额度 — KhaaliSeDin · 2026-09-06
- 阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解 — solyarisoftware · 2026-09-06
- 实测打脸宣传:Astra 着色器生成竟不敌 GLM — teortaxesTex · 2026-09-06