推理实测:投机解码在代码上快 36%,散文崩
TheMoonMidas · x · 2026-09-02
针对 MTP 和投机解码的实测显示,生成内容的类型对 tok/s 影响巨大。在同一模型和机器(M3 Max 96GB)上测试 6 个引擎:
- 代码与数学:Drafters 表现良好,因为两者具有可预测性。
- 散文:所有 drafter 均损失 17-36% 的性能,因为故事难以预测。
具体成绩:
- mlx-serve 在三者中最快,代码 39.0 tok/s,数学 41.7 tok/s,散文 32.1 tok/s。
- mlx-dspark 和 MTPLX 是数学专家。
- mlx-vlm 在散文上抗性最好,仅损失 17%。
结论:单一的 tok/s 指标往往只反映代码或单一场景,需区分测试环境。
「Infra」频道最新
- 英伟达财报解读播客:70%营收指引与毛利承压 — BenBajarin · 2026-09-02
- 双R9700跑Qwen3.8 27B达280 tok/s,MXFP4超越FP8逼近硬件极限 — whodoneit1 · 2026-09-02
- LLM 推效前沿:成本与能力的权衡技术解析 — philipkiely · 2026-09-02
- SemiAnalysis 分析韩国万亿主权 AI 投资 — zephyr_z9 · 2026-09-02
- RTX 3090 是 LLM 玩家第二大 GPU,为何没人用原生 INT8? — TheOnlyBen2 · 2026-09-02
- 教程:用 GitHub Pages 托管 RPM 软件包仓库 — unixterminal · 2026-09-02