排查 OpenCode 每轮卡顿:Qwen3.6 混合架构致 llama-server 全量重算 prompt
MysteriousInterest32 · reddit · 2026-10-05
作者在 16GB 的 4060 Ti 上用 llama-server 跑 Qwen3.6 35B-A3B(Q4KM,专家层大部分经 --n-cpu-moe 放在 CPU),配合 OpenCode 时发现每轮对话开始都有长暂停,且随会话变长而恶化。
排查过程与结论:
- 起初怀疑 PCIe 4.0 x8 带宽和 CPU↔GPU 专家层拷贝,调大 -ub 只略有改善;换到模型完全放得下的大卡,停顿变短但仍随会话增长。
- 读取服务端日志后发现,多数轮次都在「强制全量 prompt 重处理」。原因是 Qwen3.6 是混合/递归记忆架构,其 recurrent 状态无法部分回滚——新请求若与缓存序列不完全一致且没有更早的 checkpoint,服务端只能从第一个 token 重来。
- 关键触发点:聊天模板丢弃了之前轮次的思考内容,导致每次请求都变化。通过 preservethinking 让模板保留 thinking 后大部分重算消失。
- 代价:保留 thinking 使上下文更快填满,compaction 更频繁,而 compaction 的摘要序列同样无法命中缓存,重算依旧发生——最后的长会话两次全量重算都紧跟在 compaction 之后。
对本地跑混合架构模型做编码 agent 的人,这是一份很有价值的缓存失效避坑实录。
「编程与Agent」频道最新
- 阿里开源 FlyAI:在 Claude Code 里用自然语言搜机票酒店 — tom_doerr · 2026-10-05
- 用 Claude Opus 5.5 加 Blender MCP 建模湖上浮城,教程详解 — sidahuj · 2026-10-05
- 博主用 Opus5.5 配 skill 产出 vox 贴画风格视频,称效果可商用 — AlchainHust · 2026-10-05
- 测过200+工具后精选40个:让AI写出好设计的参考资源清单 — damienghader · 2026-10-05
- LISP 天然规避 agentic coding 常见问题:函数式语言或成 Agent 首选 — IgorCarron · 2026-10-05
- 开源 explain-then-fix skill:先解释再修,拒绝不懂装懂 — iamsahaj_xyz · 2026-10-05