Qwen3.8-27B 量化评测:4bit 损伤大,初始上下文崩坏最重
sadnessdevil · reddit · 2026-08-23
本文对 Qwen3.8-27B 的多种量化版本进行了 KL 散度(KLD)测试,使用代码数据集分别在 8k 和 32k 上下文下评估。主要发现包括:
- 8bit 与 4bit 差距巨大:最好的 4bit 分数(0.00835)远超最差的 8bit(0.00071)。
- 4bit 量化质量波动大:在相同模型大小下,不同校准数据和舍入算法导致 KLD 从 0.01364 到 0.02976 不等,不能仅按文件大小选择 4bit 模型。
- Group Size 影响显著:Group size 32 的表现优于 group size 128(即使后者保留部分 BF16 模块)。
- 量化损伤集中在上下文开头:所有 24 个模型在生成的前 500 个 token 处 KL 散度极高。
- 特定层量化无影响:量化 lmhead、embedtokens 和 linearattn 在此测试中未影响性能。
「研究」频道最新
- 论文提出分类分布集合 JSD 质心的计算方法 — FrnkNlsn · 2026-08-23
- 实战构建 Claude 文本水印移除器,重写法最有效 — Imaginary_Dinner2710 · 2026-08-23
- 2026 年 RSI 成核心战略,AIBuildAI 取代规模扩展 — 机器之心 · 2026-08-23
- 世界模型新基准 PlayWorld:像玩游戏一样评测长程目标 — 机器之心 · 2026-08-23
- MIT 教授展望 AI for Science:发现力过剩时代来临 — ProfBuehlerMIT · 2026-08-23
- 恶搞发布 "Ox Alpha" 新架构:递归更新潜在状态 — iruletheworldmo · 2026-08-23