极客折腾:M5 Air 32G 本地跑 300B 模型,解码达 1tps
maddie-lovelace · reddit · 2026-08-04
一位极客开发者分享了在 M5 Air(32GB 内存)笔记本上运行 300B 参数大模型(DeepSeek v4 Flash 4bit)的极限测试。
性能与优化细节:
- 速度表现:通过使用「流式专家」技巧,实现了约 50 tps 的 prefill(预填充)速度和约 1 tps 的 decode(解码)速度。
- 延迟优化:初版实现曾导致轮次间有长达 30 秒的延迟,经过优化已缩短至约 3 秒。
- 有趣发现:在 prefill 阶段减少激活的专家数量,依然能保持 95% 以上的 top logits 一致性,且在某些情况下(如大海捞针测试)性能并未受到灾难性影响。
「Infra」频道最新
- Node 22 用 node --run 替代 npm run 可省 48MB 内存 — DanielLockyer · 2026-08-04
- CoreWeave计划在印尼建设首批亚太数据中心,总功率360MW — dinabass · 2026-08-04
- MiniMax H3 速度实测:4080 显卡 3 分钟生成 5 秒高清视频 — Radyschen · 2026-08-04
- DeepSeek V4 Flash 量化评测:IQ3_XXS 速度翻倍且无损质量 — Spicy_mch4ggis · 2026-08-04
- 解析 mxfp8 量化下的转置痛点与显存优化策略 — dejavucoder · 2026-08-04
- Bittensor 推出 SayGm:一个 API 密钥调用 38 个主流大模型 — bittingthembits · 2026-08-04