Qwen 模型 TurboQuant KV Cache 导致多轮对话失效
QuixiAI · x · 2026-08-29
用户在使用 Qwen3.8-Flash-Next 模型时遇到多轮对话记忆丢失的问题,经验证发现是由 TurboQuant 量化的 KV Cache 引起的。将 KV Cache 从 TurboQuant 改回 BF16 格式后,问题得到解决。
「模型」频道最新
- Qwen 3.8 27B 量化到 Q2 还能用吗?16GB 显卡实测求证 — Effective_Head_5020 · 2026-08-29
- 实测 Opus 5.1:修复啰嗦术语,回答更直白 — daniel_mac8 · 2026-08-29
- 用户反馈 Opus 5 指令遵循能力存疑,忽视否定指令 — TheOnlyVibemaster · 2026-08-29
- 几小时花掉 100 美元,GLM 5.3 API 正常吗? — BLUECOW009 · 2026-08-29
- MiniMax H3 音频输入报错,提示 Shape Mismatch — Ok-Flatworm5070 · 2026-08-29
- Co-Scientist 评测:严重幻觉降至 4%,伪造降为 0 — SRSchmidgall · 2026-08-29