M5 Ultra 跑 Qwen 达 3740 tok/s prefill,一天内翻倍震惊业界
EAccelerate_42 · x · 2026-09-22
- @mweinbach 实测:M5 Ultra 上跑 Qwen 3.8 Flash Next 达到 3740 tok/s prefill、批处理 decode 149 tok/s,比前一天几乎翻倍。
- @EAccelerate42 对比指出:这个成绩连 2x DGX 配置在 prefill 上都赶不上,引发对端侧芯片推理性能的讨论。
「Infra」频道最新
- 民调:63%美国人反对社区建数据中心,两党罕见一致 — AlexTensor · 2026-09-22
- Toby Ord 估算:AI解千禧年大奖问题,烧了约2000万美元 — tobyordoxford · 2026-09-22
- 接入新 LLM 供应商前要检查哪些项?工程师团队的经验清单 — Rama_Surasani_ · 2026-09-22
- 开发者逆向复现 DLSS5 神经渲染,Vulkan 实现 75 层输出逐字节一致 — bdsqlsz · 2026-09-22
- 纯 C 跑 2.78 万亿参数 Kimi K3:单 CPU、8GB 内存、零框架 — tom_doerr · 2026-09-22
- LinkedIn 开源 GPU 预排序系统:图特征融合实现 50 倍模型扩容 — _reachsumit · 2026-09-22