K2-Horizon-MoVA-36B MLX 4bit 本地推理实测:最高 49.1 tok/s
DerTomsn · reddit · 2026-09-04
社区在 llm-bench.io 上放出了 K2-Horizon-MoVA-36B-A4B 的首批 oMLX(MLX 4-bit)本地推理基准结果,最高可达 49.1 tok/s。
- 实测显示它比现有的 A3B 级模型略慢
- 作者推测主要原因可能是缺少 MTP(多 token 预测)支持
- 帖子里附了与 A3B oQ8e 模型的对比链接,可供本地部署用户参考选型
「Infra」频道最新
- 推主连载科普 LLM 推理指标:TTFT、TPS、TPOT 到底在测什么 — abhijithneil · 2026-09-04
- LLM 推理科普连载:Prefill 并行读、Decode 逐 token 写的时间去哪了 — abhijithneil · 2026-09-04
- GPU 像千人工厂:逐 token 生成可能 1 人与 100 人利用率相同 — abhijithneil · 2026-09-04
- LLM 推理入门:带宽除以权重字节数,写代码前就能算出吞吐上限 — abhijithneil · 2026-09-04
- 语义缓存验证器红队测试:84% 对抗样本被放行,混入对抗数据降至 54% — Reasonable_Royal_621 · 2026-09-04
- 初创 Tensordyne 宣称新芯片性能超 Nvidia Rubin 与 OpenAI 芯片 — haifischnacken · 2026-09-04