MacBook M5 Max 跑 Qwen 350K 上下文实测

Artistic_Okra7288 · reddit · 2026-08-30

博主在 128GB M5 Max 上通过 llama.cpp 运行了 2-bit 量化的 Qwen3.8-Flash-Next 模型,实测 35.8万 tokens 上下文窗口。测试显示,利用 prefix reuse 时普通回合预填仅几秒,但闲置后冷预填需 333 秒。生成速度随上下文深度下降:小上下文约 30-35 t/s,在 16.9万 tokens 时降至 11.5 t/s。体验上,前 10万 tokens 表现强劲,超长上下文下模型出现角色混淆,可能源于低比特量化或预览版长上下文能力限制。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →