Qwen长上下文推理修复到亚秒级
marzukia · reddit · 2026-07-13
作者在 **M3 Ultra Mac Studio 96GB** 上跑 **Qwen3.5-122B** 做长上下文 agentic coding,最初遇到一个问题:跟进消息要等 3–5 分钟才开始生成,冷启动很慢。 排查后发现瓶颈不在模型,而在 serving 栈里的三个 bug: - **Prompt Instability**:系统提示词里的唯一消息 ID 破坏了 byte-exact KV cache 匹配,导致每轮都要重算; - **Interrupt Path**:流式回复被中断时没有持久化,造成历史状态分叉; - **Checkpoint Poison**:后台写入了不可匹配的 checkpoint,挤掉有效缓存,触发更激进的淘汰。 修完后,prefill 从分钟级降到亚秒级,例如 53k tokens 已缓存、只需 33 个 token 重新 prefill。作者因此选择直接 fork 而不是向上游提 PR,因为这些 hybrid attention 优化很偏 Qwen 架构,可能不适合通用栈。 他已经把 fork 和基准脚本开源,并提供了区分 prefill/decode 的 benchmark。
「编程与Agent」频道最新
- Agent Arena 发布 agent 评测因果追踪方法与完整榜单 — arena · 2026-07-21
- Codex Micro 把多智能体混乱做成了状态面板梗图 — shaunralston · 2026-07-21
- Anthropic 开发者体验负责人将讲 coding agents 的 API 体验 — craigsdennis · 2026-07-21
- 企业正在招聘 AI Agent 工程师,IBM 列出 7 项核心技能 — ZabihullahAtal · 2026-07-21
- 开源先解决信任,再解决流量 — dotey · 2026-07-21
- Profound成为Anthropic官方连接器 — ditzikow · 2026-07-21