分层摘要压到 8k 上下文,Qwen 长对话 120 条后仍崩溃

Zeeplankton · reddit · 2026-09-09

一位开发者在 Reddit 分享了其聊天应用的对话压缩(compaction)实践:递归生成分层摘要 L1→L2→L3——L1 偏事实抽取,L2 再整合成叙事性更强的摘要,同时保留约 10 条带时间戳的原始消息作为尾部,使上下文稳定在 5-8k token。

但即使上下文很短,对话进行到约 120-140 条消息后,Qwen Flash Next 仍出现严重退化:输出迅速变得不连贯甚至荒诞。作者疑惑 8k token 对 Qwen 应该绰绰有余,且检查 payload 发现内容基本连贯,因此怀疑问题可能出在摘要本身对模型连贯性的「污染」,并征集其他人在对话压缩上的经验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →