M2 Ultra 跑大模型太慢?Reddit 网友提议预提交系统提示做预热缓存

butterfly_labs · reddit · 2026-09-20

一位在 M2 Ultra 上本地运行 DS4 Flash、Qwen3.8 Flash 等大模型的开发者发现:编码 agent 每次会话开头的系统提示、工具定义、skills 等固定开销,在慢速 prompt processing 的机器上要 2-3 分钟才能处理完,之后上下文被缓存、后续轮次明显变快。

他提出一个优化思路:既然这些开销对同一项目是固定的,可以让 harness(他使用 Opencode)在打开项目时就预提交这些固定上下文,让机器在用户输入第一条提示的同时完成预热处理。帖子在征求该方案的可行性意见。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →