长上下文模型会抄无关文本,新奖励最高提升 4.6 个点
rohanpaul_ai · x · 2026-07-23
长上下文模型仍会浪费算力:它们常把无关文本抄进推理里
这篇论文指出,即使是能力很强的长上下文推理模型,也会陷入一种“重复复制”的坏习惯:不是抓住关键证据,而是把输入里大段内容抄进思考过程,导致 token 预算被吃掉、准确率下降。
- 输入越长,这种复制行为越明显。
- 复制真正相关的几行内容通常有帮助;复制周围的填充内容则会拉低表现。
- 作者提出 GEAR(Grounding Evidence-Aware Reward):一种奖励塑形方法,鼓励模型围绕关键证据展开推理,同时惩罚与无关上下文的重复。
- 他们还做了一个自动化流水线,能从任意文档中构造带证据标注的训练数据。
- 实验显示,在多个模型规模和基准上,方法相较标准 RL 奖励最多提升 4.6 个百分点,同时减少重复复制和“思考”长度。
这项工作的核心结论是:长上下文推理的关键仍然是准确 grounding 到证据,而不只是把上下文窗口做大。
所属事件:研究揭示长上下文模型存在复制冗余缺陷(2 条相关)→
「研究」频道最新
- MetaCircle 提出不依赖 LLM 的机械式自动研究 — ZimingLiu11 · 2026-07-23
- kalomaze:扩散模型基线把去噪与理解强行绑在一起 — kalomaze · 2026-07-23
- HiSME 让 LLM Agent 连“学技能的方法”也能继续进化 — 机器之心 · 2026-07-23
- 超网络在 LLM 事实知识注入上呈现幂律缩放 — Nischay Dhankhar · 2026-07-23
- 视频扩散仍在依赖八到十一年前的评测指标 — kalomaze · 2026-07-23
- DSpark 在在线 SGLang 上蒸馏,B200 解码吞吐提升 1.89 倍 — ying11231 · 2026-07-23