分层摘要压到 8k 上下文,Qwen 长对话 120 条后仍崩溃
Zeeplankton · reddit · 2026-09-09
一位开发者在 Reddit 分享了其聊天应用的对话压缩(compaction)实践:递归生成分层摘要 L1→L2→L3——L1 偏事实抽取,L2 再整合成叙事性更强的摘要,同时保留约 10 条带时间戳的原始消息作为尾部,使上下文稳定在 5-8k token。
但即使上下文很短,对话进行到约 120-140 条消息后,Qwen Flash Next 仍出现严重退化:输出迅速变得不连贯甚至荒诞。作者疑惑 8k token 对 Qwen 应该绰绰有余,且检查 payload 发现内容基本连贯,因此怀疑问题可能出在摘要本身对模型连贯性的「污染」,并征集其他人在对话压缩上的经验。
「编程与Agent」频道最新
- Nous Research 推 Hermes Agent,主打'终生自有'的 AI 栈 — Teknium · 2026-09-09
- 一人公司实操:用 Codex+Apify+SQLite 搭出 AI 找客户全流程 — aryanXmahajan · 2026-09-09
- GitHub 揭秘 Copilot 降本四招:省 token 不等于省成本 — marlene_zw · 2026-09-09
- 开源 Mac MCP 2.0:81 个工具让 AI 智能体接管 macOS 与后台浏览器 — bulutarkan · 2026-09-09
- Teknium 实测 Hermes 跑 19 小时、1390 个子代理零失败 — Teknium · 2026-09-09
- 给 ChatGPT 接上本地 Mac 控制:开发者复盘构建 MCP 服务器的经验 — bulutarkan · 2026-09-09