MacBook M5 Max 跑 Qwen 350K 上下文实测
Artistic_Okra7288 · reddit · 2026-08-30
博主在 128GB M5 Max 上通过 llama.cpp 运行了 2-bit 量化的 Qwen3.8-Flash-Next 模型,实测 35.8万 tokens 上下文窗口。测试显示,利用 prefix reuse 时普通回合预填仅几秒,但闲置后冷预填需 333 秒。生成速度随上下文深度下降:小上下文约 30-35 t/s,在 16.9万 tokens 时降至 11.5 t/s。体验上,前 10万 tokens 表现强劲,超长上下文下模型出现角色混淆,可能源于低比特量化或预览版长上下文能力限制。
「Infra」频道最新
- 开发者 Azure Linux 4.0 桌面化实测:预装 PowerShell 与 Copilot — unixterminal · 2026-08-30
- 黄仁勋:先造技术再找问题,算力统一物理与生物 — r0ck3t23 · 2026-08-30
- 如何从零构建 LLM 推理引擎:拆解 5 层架构 — glenbeer · 2026-08-30
- 华勤预计 2026H2 超级节点收入破百亿,三大云厂商下巨额订单 — zephyr_z9 · 2026-08-30
- 英伟达日赚 10 亿美元,几年前的商业神话照进现实 — shauntrennery · 2026-08-30
- Krishnan:太空数据中心直连人类神经中枢将「正常得可怕」 — sebkrier · 2026-08-30