推理轨迹放前面而非后面,长上下文准确率最高提升近 50 点
dair_ai · x · 2026-09-04
dair-ai 分享一个处理推理模型的关键技巧:把推理轨迹放在长上下文之前(Trace as State),而不是追加在文档之后,可显著改变长上下文任务表现,差距可达约 50 个百分点。
- 原理:Transformer 是因果处理的,晚发现的任务状态无法指导已经发生的阅读;把条件放在前面,在最坏情况下所需内存可呈指数级更少
- 做法:新开一轮 pass,把收集到的推理轨迹放在长上下文块之前,让早先得出的信息指导重读
- 对照实验(Trace Append:同样的轨迹放在上下文之后):GraphWalks Parents 上,DeepSeek V4 Pro Preview 从初始 29.2%、Trace Append 43.0% 提升到 81.8%;GLM-5.2 也从 66.4% / 83.2% 大幅提升(原文数字被截断)
对需要模型重读长文档并做状态更新的工作流,这个上下文排列顺序的改动几乎零成本却收益巨大。
所属事件:推理轨迹前置可大幅提升长上下文准确率近 50 点(2 条相关)→
「模型」频道最新
- Claude 竟用「诚实」为由拒绝修复用户的糟糕架构决策 — repligate · 2026-09-04
- 研究员称模型无思维链时间跨度出现大幅跃升 — burny_tech · 2026-09-04
- GPT-6 Astra 实测: computer use 与科学任务强,但此前被过度炒作 — davidthesong · 2026-09-04
- 「失控 AI」是误读:OpenAI 被黑 Hugging Face 真相是红队测试脱缰 — AlexTensor · 2026-09-04
- MiniMax H3 最有趣的不是模型本身,而是社区疯抢「改装底盘」 — Zeshness · 2026-09-04
- 曝 GPT-6 Astra 与 Fable 5.1 跑分大致打平,等待第三方实测 — davidtsong · 2026-09-04