分析:Qwen 3.8 27B 被指通过 GRPO 蒸馏 DeepSeek-R1
mishig25 · x · 2026-08-15
有分析提出假设,Qwen 3.8 27B 模型的出色表现可能源于对 DeepSeek-R1-zero 的蒸馏。该观点认为,Qwen 3.8 27B 并未依赖传统的监督微调(SFT)或海量训练数据,而是以 Qwen 3.8 Max 的输出为强化学习目标,采用了更宽松的推理上下文长度进行 GRPO(Group Relative Policy Optimization)训练。这种方法被描述为在特定语境下优于传统的 K/L 散度蒸馏,强调“智能是解而非压缩”。
「模型」频道最新
- Anthropic 公开内部 AI 自动化研究基准 — sachdh · 2026-08-15
- Qwen/QwQ-32B-Preview 全精度版登陆 HuggingChat — victormustar · 2026-08-15
- 阿里开源 27B 多模态模型,单卡本地跑、编程逼近 Claude Opus — rohanpaul_ai · 2026-08-15
- 24GB 显卡跑 Muse 还是 Qwen?Reddit 实测对比 — Viktri1 · 2026-08-15
- 开发者警告:GLM未调用analyze_image时可能并未真正读图 — DevDminGod · 2026-08-15
- 阿里开源模型半年下载 30 亿,超 Meta 成全球第一 — kimmonismus · 2026-08-15