亚马逊论文:匹配 KV-Cache 策略可防长文崩坏
rohanpaul_ai · x · 2026-08-31
亚马逊新论文指出,KV-cache 策略不仅是推理优化,更应改变模型训练方式。若推理时模型会遗忘上下文,训练时就应模拟这种遗忘。
- 问题:稀疏注意力允许长上下文推理使用固定大小 KV cache,但模型通常用全注意力微调,推理时记忆缺失会导致行为崩坏。
- 发现:在 128k token 测试中,全注意力训练的模型在稀疏推理下常产生长篇无意义回答,而用相同 cache 策略微调的模型则能正常回答并停止。
- 方法:论文提供了在任意 cache 策略下进行策略匹配训练的实用方法,包括在 40GB A100 上计算 4B 模型梯度的方案。
所属事件:亚马逊论文:训练需匹配推理时 KV 缓存策略(2 条相关)→
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01