ByteShape 发布 Qwen 3.8 27B 全系量化:3.84bpw 达 BF16 精度 99.63%
enrique-byteshape · reddit · 2026-09-15
ByteShape 在 r/LocalLLaMA 发布了完整的 ShapeLearn GGUF 量化模型(Qwen 3.8 27B),并公布了系统评测结果:
- 精度:3.84 bpw(GPU-5)达到 BF16 八项基准综合分的 99.63%,是评测过最准的量化;3.23 bpw(GPU-4)仍达 98.72%。
- 对比:与 Unsloth v3、ISTA-DASLab、AtomicChat、Bartowski 比较,五个新模型在六块 GPU(RTX 6000 Pro Blackwell、5090、4090、3090、4080、5060 Ti)上均落在质量/速度-bpw 前沿;此前『赶工发布』的 Lite 版也在对比中拿下 6 个前沿位中的 3 个。
- KLD 不等于质量:Unsloth UD-IQ3S 的 KLD 比同尺寸 Lite 低约 20%,任务分数却更差(95.55% vs 97.33%)。作者结论:KLD 只能用来剔除『垮掉』的量化,不能当量化排行榜——这是其被 EMNLP 2026 Industry Track 接收的论文核心论点。
- 推理加速:DFlash2 带来 1.34–2.10× 吞吐提升,MTP 为 1.28–1.66×(温度采样下)。
- 基准覆盖:GSM8K、MMLU、IFEval、LiveCodeBench V6、Multi-IF、ACEBench、Multiple HumanEval、BFCL V4,兼顾 instruct 与 thinking 模式。
「Infra」频道最新
- Oracle 裁员次日新 CFO 全员会:不喜欢「少花钱多办事」这个说法 — mkheck · 2026-09-16
- OpenAI 透露 Astra 在 Rubin 芯片上自我优化 72 小时推理再翻倍 — bookwormengr · 2026-09-16
- 开源端侧语音模型 Audio8:ASR/TTS 七个规格,iPhone 离线转写可用 — FinanceYF5 · 2026-09-16
- RTX Pro 6000 全面售罄,买家称交货周期已长达 8 个月 — Sentdex · 2026-09-16
- Anthropic 已官宣超 11.5GW 算力,满负荷年账单或达 1200 亿美元 — FinanceYF5 · 2026-09-16
- NVIDIA 官方讲解:Dense 与 MoE 架构如何选,部署权衡全解析 — NVIDIA Developer · 2026-09-16