长上下文模型会抄无关文本,新奖励最高提升 4.6 个点
rohanpaul_ai · x · 2026-07-23
长上下文模型仍会浪费算力:它们常把无关文本抄进推理里
这篇论文指出,即使是能力很强的长上下文推理模型,也会陷入一种“重复复制”的坏习惯:不是抓住关键证据,而是把输入里大段内容抄进思考过程,导致 token 预算被吃掉、准确率下降。
- 输入越长,这种复制行为越明显。
- 复制真正相关的几行内容通常有帮助;复制周围的填充内容则会拉低表现。
- 作者提出 GEAR(Grounding Evidence-Aware Reward):一种奖励塑形方法,鼓励模型围绕关键证据展开推理,同时惩罚与无关上下文的重复。
- 他们还做了一个自动化流水线,能从任意文档中构造带证据标注的训练数据。
- 实验显示,在多个模型规模和基准上,方法相较标准 RL 奖励最多提升 4.6 个百分点,同时减少重复复制和“思考”长度。
这项工作的核心结论是:长上下文推理的关键仍然是准确 grounding 到证据,而不只是把上下文窗口做大。
所属事件:研究揭示长上下文模型存在复制冗余缺陷(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11