Qwen3.8 剪枝实验:256 专家为平衡点,Q4 优于 Q2
EyalToledano · x · 2026-08-27
作者对 Qwen3.8-Flash-next 进行了剪枝曲线测试,分析模型大小与精度的权衡:
- 最佳剪枝点:保留 256 个专家是“甜点区”,模型大小减半后精度才开始显著下降。
- 剪枝策略:随机剪枝导致模型崩溃,证明保留哪些专家至关重要。
- 量化对比:尝试 Q2 量化(保留全专家,63GB)输出质量极差;Q4 量化配合半数专家的效果远优于前者。
「模型」频道最新
- 曝年底前推出类 Her 语音模式,或随 GPT-6 发布 — flowersslop · 2026-08-27
- GLM 5.3 Flash 上线 90% 折扣,输出生成单价低至 0.04 美元 — shensi · 2026-08-27
- Dry 5.6 Sol 聊天场景谄媚,目标导向时正常 — Sauers_ · 2026-08-27
- 回顾 Nous 首个模型:基于 18 万条 GPT-4 数据的微调版 — Teknium · 2026-08-27
- OpenAI 千智体自发建群引热议,GLM-5.3 与 Qwen4 同周发布 — altryne · 2026-08-27
- Opus 5 耗用 5 倍令牌才达 GPT 5.6 同等准确率 — abeirami · 2026-08-27