DeepSeek-V4-Flash 避坑:对话中途插入 system 消息会破坏缓存
CharlesStross · reddit · 2026-08-02
开发者 Charles Stross 分享了一个关于 DeepSeek-V4-Flash 模型使用的重要避坑指南:在对话中途插入 system 角色的消息会导致前缀缓存失效,从而大幅降低响应速度并增加 API 成本。
原因分析:DeepSeek 官方的聊天模板格式不支持在对话中途插入系统消息。如果强行在对话中间或末尾添加 system 消息,会破坏原本的上下文结构,导致前缀缓存被“烧毁”。
解决方案:应使用 latestreminder 这一角色来替代传统模板中 system 的用法。这是 DeepSeek 在训练时专门适配的角色,能够正常通过 llama.cpp 等推理引擎传递,从而保持缓存的命中率。
「模型」频道最新
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- 隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6 — scaling01 · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24