Qwen3.8 蒸馏版 9B/4B/2B 发布:MMLU 跑分翻倍
alejandroll10 · x · 2026-08-17
社区发布了基于 Qwen3.8-2.4T-A95B 的蒸馏模型,规模为 9B/4B/2B。通过全参数 SFT 和精心筛选的教师 CoT 数据,小模型能力显著提升:9B 模型 MMLU 从 54.6 升至 75.1,4B 从 35.4 升至 55.3,2B 从 28.3 升至 54.8。目前权重和 GGUF 格式已发布。
「模型」频道最新
- 端侧新标杆:Qwen2.5 2B 手机仅需1GB显存,MMLU提升至54.8 — alexcovo_eth · 2026-08-17
- 爆料:新版 Claude/GPT API 强制 Temp 为 1 — andersonbcdefg · 2026-08-17
- Grok观看视频后学到了什么? — Scobleizer · 2026-08-17
- 实测:Gemini 3.7 Flash 多模态与指令处理大飞跃 — haider1 · 2026-08-17
- 求推荐适合低延迟聊天的开源模型 — dnivra26 · 2026-08-17
- Codex 将迎来更新:宣称接近 100% 可靠且开源 — soumitrashukla9 · 2026-08-17