Qwen3.8-Flash-Next 本地实测:128GB Mac 首个破 94% 的模型
tolitius · reddit · 2026-08-27
开发者在 M4 Max 128GB Studio 上用 oMLX 和 llama.cpp 实测 Qwen3.8-Flash-Next:这是今年第一个在其自建 cupel 基准上突破 94% 的模型。
- 由于 qwen4exp 架构尚不支持,需禁用 oMLX 的 K/V 缓存;4bit 量化整体约 100GB,128GB 内存刚好够用
- 编码、通识、科学混合基准下,Qwen 3.8 27B 编码最强但通识输给 Gemma 31B 和 Qwen 3.6
- 量化选择:MLX 混合 4/8bit 量化(pipenetwork)表现最佳,困惑度 4.5286 vs bfloat16 的 4.4708;Unsloth 的 GGUF UD-IQ4XS 稍弱但更省空间
作者表示模型已强到难以区分,后续会在基准中加入更多编码工具链(如 pi/opencode)测试。
「模型」频道最新
- Mollick 警告:别把人格投射进 METR 报告的 agent — emollick · 2026-08-27
- Zai 开源 320B 模型 GLM-5.3-Flash,原生多模态且全在华芯运行 — ccerrato147 · 2026-08-27
- Perplexity Computer 发布:支持本地/云端多端,评测称达 85.4% — ChrisUniverse · 2026-08-27
- 吐槽 Claude 输出风格:辞藻堆砌但信息密集 — TheZvi · 2026-08-27
- GLM-5.3 Flash 测评:修复 13 个 Bug,性价比突出 — PawelHuryn · 2026-08-27
- Opus 5 写作质量退步获基准测试证实 — gleech · 2026-08-27