RUC 提出 STAIR:仅训 1.2 万参数,历史上下文让多轮推理准确率提升 11.67 点
RUC · hf · 2026-10-05
中国人民大学团队研究 LLM 在同一对话中处理独立问题时,先前问题的计算能否帮助解决新问题。
发现:保留的历史上下文既可能提高也可能降低后续轮次的准确率,即使在同领域内也是如此。团队用受控回放(controlled replay)隔离每个「问题-历史」组合特有的内部状态变化,发现不同历史下这些变化在当前问题间保持相似的关系结构。
方法 STAIR(Stale-Token Attention for Inter-query Reuse):
- 将早期响应生成的 key/value 存入固定 bank;
- 训练模型在处理 prompt 时,把当前查询重定向到该 bank;
- 基座模型冻结,仅训练 12,288 个参数。
结果:在三个 Qwen 模型和四个 benchmark 上,STAIR 使带历史的后续轮次平均准确率最高提升 11.67 个百分点。
「研究」频道最新
- Grand Canonical Generators 用生成模型采样巨正则系综 — CatAstro_Piyush · 2026-10-06
- SWE-Chat v2 发布:18K 真实用户 23 万条编码 Agent 交互数据集 — Diyi_Yang · 2026-10-06
- ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐 — Michael_D_Moor · 2026-10-06
- 每加一条规则都更糟:LLM Agent 提示词踩坑复盘 — Adorable-Algae6903 · 2026-10-06
- World Labs 发布 LoGo:局部+全局奖励提升视频生成 3D 一致性 — georgiagkioxari · 2026-10-06
- Harbor 统一评测与 RL rollout 契约,直击 agent 基准三大落地难题 — rseroter · 2026-10-06