Qwen长上下文推理修复到亚秒级

marzukia · reddit · 2026-07-13

作者在 **M3 Ultra Mac Studio 96GB** 上跑 **Qwen3.5-122B** 做长上下文 agentic coding,最初遇到一个问题:跟进消息要等 3–5 分钟才开始生成,冷启动很慢。 排查后发现瓶颈不在模型,而在 serving 栈里的三个 bug: - **Prompt Instability**:系统提示词里的唯一消息 ID 破坏了 byte-exact KV cache 匹配,导致每轮都要重算; - **Interrupt Path**:流式回复被中断时没有持久化,造成历史状态分叉; - **Checkpoint Poison**:后台写入了不可匹配的 checkpoint,挤掉有效缓存,触发更激进的淘汰。 修完后,prefill 从分钟级降到亚秒级,例如 53k tokens 已缓存、只需 33 个 token 重新 prefill。作者因此选择直接 fork 而不是向上游提 PR,因为这些 hybrid attention 优化很偏 Qwen 架构,可能不适合通用栈。 他已经把 fork 和基准脚本开源,并提供了区分 prefill/decode 的 benchmark。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →