M5 Ultra 256GB 实测:Qwen3.8 200K 预填充快 Laguna 10 倍

nonlinearsystems · reddit · 2026-10-01

作者在 Mac Studio M5 Ultra 256GB 上同日同 harness 对比 Qwen3.8-Flash-Next(oMLX,182GB oQ8e,MTP)与 Laguna-S-2.1(GGUF,128GB 8bit),均开思考、262K 上下文、每轮零缓存 token:

作者还踩坑提示:跨规模共享前缀会让 KV cache 复用,导致首轮测出 21s「预填充 200K」的假数据。结论:若 Laguna 解决 DFlash 或上 MTP,战局可能改写。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →