M5 Ultra 256GB 实测:Qwen3.8 200K 预填充快 Laguna 10 倍
nonlinearsystems · reddit · 2026-10-01
作者在 Mac Studio M5 Ultra 256GB 上同日同 harness 对比 Qwen3.8-Flash-Next(oMLX,182GB oQ8e,MTP)与 Laguna-S-2.1(GGUF,128GB 8bit),均开思考、262K 上下文、每轮零缓存 token:
- 预填充:Qwen 保持约 4,200 tok/s 线性,200K 仅 47.1s;Laguna 因二次方注意力超线性退化,200K 需 455.4s,差近 10 倍。200K 时预填充占两模型总时间 94%。
- 解码:Qwen 59-74 tok/s(MTP 接受率 70-76%,约 2 倍加速);Laguna 从 68 降至 34 tok/s。
- 质量:四个脚本验证题各对 4/4 打平,但风格相反——Laguna 几百 token 快答,Qwen 曾用 119s/11K token 深思。
作者还踩坑提示:跨规模共享前缀会让 KV cache 复用,导致首轮测出 21s「预填充 200K」的假数据。结论:若 Laguna 解决 DFlash 或上 MTP,战局可能改写。
「Infra」频道最新
- Google 研究副总裁:捐款盖楼不如资助高校算力云 — jasondeanlee · 2026-10-01
- 本地跑 Qwen 每小时约 0.12 欧电费,用户算账质疑是否反而更贵 — soyalemujica · 2026-10-01
- Cognition 成 CoreWeave Vera Rubin 首个客户,吞吐达 GB200 约4.8倍 — silasalberti · 2026-10-01
- 微软 Foundry 系列开篇:模型越强,内容抽取层越不可省 — adnan_hashmi · 2026-10-01
- 美光季度营收近翻四倍至542亿美元,大超市场预期 — Polymarket · 2026-10-01
- 坐拥 TPU 却算力饥荒:Google 内部各团队抢算力乱象盘点 — zacharynado · 2026-10-01