亚马逊论文:训练需匹配推理时 KV 缓存策略
亚马逊最新论文指出,KV 缓存策略不只是推理端的优化手段,更应反过来决定模型的训练方式。由于长上下文推理中稀疏注意力会让模型遗忘部分上下文,导致长文处理效果崩坏,研究主张在训练阶段就模拟这种遗忘行为,使训练与推理保持一致。论文通过实验证明,这种匹配式微调能有效缓解长上下文的性能退化问题。
2026-08-31 ~ 2026-08-31 · 2 条相关
- 亚马逊论文:匹配 KV-Cache 策略可防长文崩坏 — rohanpaul_ai · 2026-08-31
- 长上下文会失效?亚马逊论文称需匹配 KV 缓存策略微调 — eyishazyer · 2026-08-31