排查 OpenCode 每轮卡顿:Qwen3.6 混合架构致 llama-server 全量重算 prompt

MysteriousInterest32 · reddit · 2026-10-05

作者在 16GB 的 4060 Ti 上用 llama-server 跑 Qwen3.6 35B-A3B(Q4KM,专家层大部分经 --n-cpu-moe 放在 CPU),配合 OpenCode 时发现每轮对话开始都有长暂停,且随会话变长而恶化。

排查过程与结论:

对本地跑混合架构模型做编码 agent 的人,这是一份很有价值的缓存失效避坑实录。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →