清华揭示硬提示压缩致命缺陷:指代悬垂致准确率骤降

Tsinghua · hf · 2026-08-10

清华大学研究指出,当前硬提示词压缩方法存在一种名为「指代悬垂」的结构性缺陷。在独立评估并保留高分文本片段时,算法容易切断具有依赖关系的证据对,导致保留下来的答案因缺失关键实体定义而无法被模型理解。

实验表明,在 0.3 的压缩率下,所有主流压缩方法在多跳问答数据集中出现悬垂的比例高达 60%。即使是最新的 GPT-5.5 模型也无法弥补这种信息缺失,其准确率相比完整上下文下降了 8.8 个百分点。

为此,研究团队训练了一个轻量级分类器,专门对被删除的句子进行重新排序,并在推理时自动补全缺失的指代背景。该方法在几乎不改变压缩率(从 0.30 升至 0.31)的情况下,成功将准确率提升了 4.7 个百分点。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →