REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选
MensaProdigy · reddit · 2026-09-22
Reddit 用户 MensaProdigy 发布了三个面向 Apple Silicon 的 Qwen3.8-Flash-Next REAP 剪枝 MLX 构建,并给出基于实测数据的选型决策边界:
- 共同结构:48 层 transformer、top-10 路由、保留 512 专家原生 MTP 预测器、262k 上下文;虽名为 BF16,实际是混合精度包
- REAP-384 oQ5e(M4 Max 128GB):HumanEval 97/100(无思考)、LiveCodeBench 61-62/100,峰值显存 72.8 GB
- REAP-384 oQ4e:HumanEval 91-95,LiveCodeBench 55-56,峰值 61.5 GB、生成 59.3 tok/s,比 oQ5e 省 11.3 GB 且更快
- REAP-288 oQ4e:峰值仅 46 GB,比 384 oQ5e 低 26.8 GB,是最大显存余量选项
- 与社区 Jundot oQ4e MTP 包对比(LiveCodeBench 55% vs 62%)作者强调并非控制变量对比——硬件、专家数、量化均不同,只是参考
- 作者反复强调所有成绩为 100 题分层抽样,不应视为统一榜单排名
「Infra」频道最新
- World Models 创业公司 Reactor 融资 5900 万美元,做世界模型开发者平台 — buckymoore · 2026-09-22
- Meta 发布 Petal:全球首条 Pbps 级跨洋海缆,采用多芯光纤,2029 年投用 — Meta_Engineers · 2026-09-22
- 史上最大规模发布之一却保持高可用,平台团队获业内称赞 — hardimanjames · 2026-09-22
- Ben Bajarin:智能体时代数据中心 CPU:GPU 配比之争重燃 — BenBajarin · 2026-09-22
- AMD 发布 EPYC Venice 白皮书:SPEC 整数性能 2.24 倍于 Vera — ryanshrout · 2026-09-22
- python-build-standalone 为 CPython 3.12+ 启用全量 LTO 提升运行性能 — charliermarsh · 2026-09-22