M2 Ultra 跑大模型太慢?Reddit 网友提议预提交系统提示做预热缓存
butterfly_labs · reddit · 2026-09-20
一位在 M2 Ultra 上本地运行 DS4 Flash、Qwen3.8 Flash 等大模型的开发者发现:编码 agent 每次会话开头的系统提示、工具定义、skills 等固定开销,在慢速 prompt processing 的机器上要 2-3 分钟才能处理完,之后上下文被缓存、后续轮次明显变快。
他提出一个优化思路:既然这些开销对同一项目是固定的,可以让 harness(他使用 Opencode)在打开项目时就预提交这些固定上下文,让机器在用户输入第一条提示的同时完成预热处理。帖子在征求该方案的可行性意见。
「编程与Agent」频道最新
- 开发者自制 Apple Silicon 推理引擎,注意力显存砍掉 128 倍 — Accomplished_Row1433 · 2026-09-20
- Reddit 热议:别把 Agent 做小了,该造的是「持久化 AI 组织」 — Druss_ · 2026-09-20
- 不用买产品:一位业余玩家自建 Agent 长期记忆系统的方法论 — GrungeWerX · 2026-09-20
- AI 工程师忠告:没有 evals,构建应用等于盲飞 — antoine_chaffin · 2026-09-20
- 联合国联合 Google 把全球统计数据接入 MCP,支持可引用数字 — emmanuelvivier · 2026-09-20
- 低延迟模型实时打《街霸 2》:每 300ms 决策一次 — Smartaces · 2026-09-20