Qwen3.8-Flash-Next Mac 端极致优化:线性稀疏注意力+SSD 流式
memeka · reddit · 2026-08-30
开发者在 M1 Max 64GB 上实现了对 Qwen3.8-Flash-Next 的极致优化,支持张量、Engrams 和 MTP 的 SSD 流式加载。核心技术点包括:
- 自定义 Q4 量化:混合拼接多个 Unsloth 和 AtomicChat 量化张量,平衡性能与比特率。
- Metal 稀疏注意力:自研机制将复杂度从二次方降至近似线性。
- 动态 MTP:在上下文增大导致 MTP 收益为负时自动关闭。
- KV Cache 抉择:开启 MTP 会占用更多 RAM,导致 Prefill 速度从 180 tps 降至 170 tps,但 Decode 提升 70% 至 22 btps。
作者特别致谢 Claude,称其提供了大量 Token 辅助开发。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01