Qwen 模型 TurboQuant KV Cache 导致多轮对话失效

QuixiAI · x · 2026-08-29

用户在使用 Qwen3.8-Flash-Next 模型时遇到多轮对话记忆丢失的问题,经验证发现是由 TurboQuant 量化的 KV Cache 引起的。将 KV Cache 从 TurboQuant 改回 BF16 格式后,问题得到解决。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →