iPhone 变身 MacBook 外挂 GPU:Qwen 27B 预填充提速最多 44%
StayLameBro · reddit · 2026-10-03
开发者把 iPhone 17 Pro Max 通过 10Gb/s USB-C 线接到 24GB M4 Pro MacBook,给 Qwen 3.8 27B (IQ4XS) 本地推理加了一个「外挂 GPU」:
- 分层流水线:Mac 跑每批 256-token 的第 1–40 层,把激活值流式传给手机跑第 41–64 层,A19 Pro GPU 的 Metal 4 tensor ops 让手机侧快 2.4 倍。
- 预填充实测:+35%44%(16k 上下文时 109→157 tok/s);27k-token agent 会话冷启动从 245s 降到 168s。
- 超过 64k 后换角色:旧 KV 页迁到手机,手机 GPU 对旧 key 做注意力,Mac 合并结果;写入阶段还把旧上下文编译成 Neural Engine 模型(key 作为权重),140k 时单 token 写入从 279ms 降到 176ms。
- 内存扩展:最多约 5.7GB KV cache 放在手机上,8-bit 上下文可扩到 196k–229k,已测试 128k 会话事实召回正常。
- 局限:64k 以下不加速写入;实际使用中低上下文可达 30+ TPS。
- 配套的内核优化(SME2 + Metal 融合 + DFlash2 投机解码)把 llama.cpp 的 11.3 tok/s 提到 25 tok/s。
代码、配置和基准脚本已开源(GitHub: backburner),整个项目是与 Claude Opus 5.5 协作完成的。
「编程与Agent」频道最新
- jasonkneen:所有个人 Agent 产品都没解决同一个根本问题 — jasonkneen · 2026-10-03
- 开发者自建 WoW 私服并用 MCP Agent 在浏览器里自动玩游戏 — ProfessorMunchy · 2026-10-03
- YC 推出团队协作 AI Agent 工具 QM,可在 Agent37 免费使用 — ycombinator · 2026-10-03
- OpenAI DevDay 直播前 5 分钟,Codex 旗下 Dot 主动报告生产事故 — lennysan · 2026-10-03
- LangChain 创始人转评:Agent 上生产环境必须「持久化」 — hwchase17 · 2026-10-03
- 无向量库长文档检索:Jev+PageIndex 树形搜索开源方案 — gaganghotra_ · 2026-10-03