亚马逊论文:训练需匹配推理时 KV 缓存策略

亚马逊最新论文指出,KV 缓存策略不只是推理端的优化手段,更应反过来决定模型的训练方式。由于长上下文推理中稀疏注意力会让模型遗忘部分上下文,导致长文处理效果崩坏,研究主张在训练阶段就模拟这种遗忘行为,使训练与推理保持一致。论文通过实验证明,这种匹配式微调能有效缓解长上下文的性能退化问题。

2026-08-31 ~ 2026-08-31 · 2 条相关