分析:Qwen 3.8 27B 被指通过 GRPO 蒸馏 DeepSeek-R1

mishig25 · x · 2026-08-15

有分析提出假设,Qwen 3.8 27B 模型的出色表现可能源于对 DeepSeek-R1-zero 的蒸馏。该观点认为,Qwen 3.8 27B 并未依赖传统的监督微调(SFT)或海量训练数据,而是以 Qwen 3.8 Max 的输出为强化学习目标,采用了更宽松的推理上下文长度进行 GRPO(Group Relative Policy Optimization)训练。这种方法被描述为在特定语境下优于传统的 K/L 散度蒸馏,强调“智能是解而非压缩”。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →