换 AWQ W4A16 量化 + vLLM 补丁后,本地 Qwen 3.8 Flash Next 基准从 91 升到 98
WonderRico · reddit · 2026-09-05
博主 WonderRico 更新本地 LLM 基准:为 Qwen 3.8 Flash Next 换用基于 vLLM 的新方案,得分从 91/100 提升到 98/100。
- 新方案:AWQ W4A16 权重 + INT4 的 n-gram PLE 量化(均来自 Hugging Face),配合 primitive-ai 仓库的 vLLM 补丁
- 目标是让权重和 PLE 都以 4bit 加载到 sm89/sm120 设备;虽比之前的 SGLang 补丁方案更慢,但质量提升明显
- 中/超高推理档下都达到 98 分,成为其基准中得分最高且最高效的组合
- 作者将继续排查差异来自引擎补丁还是量化本身;图表与数据已公开在 GitHub Pages
「Infra」频道最新
- 实测踩坑:Agent 产品真正的瓶颈是每分钟 token 上限而非延迟 — Initial_Orange2985 · 2026-09-05
- 估算:全球算力约合 2000 万 H100,推理占大头,预训练效率远逊生物 — JosephJacks_ · 2026-09-05
- Tenstorrent 联手 aiand 推出 JapanFold:免费开源药物发现模型登陆日本 — DavidBennett__ · 2026-09-05
- Aer Lingus 一半远程机队已装上 Starlink,年内全覆盖 — elonmusk · 2026-09-05
- 开发者用 Qwen3.8-27b-mlx 在 M5 MacBook 本地跑通网页与素材生成 — walkingriver · 2026-09-05
- 开源Agent Substrate:让K8s智能体秒级挂起恢复、密度提升10倍 — davemccollough · 2026-09-05