LoongReflect 给智能体加可回溯反思,多跳问答 F1 涨 12.6

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

cs.LG, cs.AI

2026-08-12

LoongReflect 把反思当成可回溯的记忆控制,用教师蒸馏+GRPO 双通道训练,多跳问答平均 F1 较最强基线高 12.6 分。

这篇在解决什么

长程智能体(做规划、调工具、维护记忆的那种)需要反思:判断当前轨迹有没有进展、缺什么证据、哪一步不可靠、该继续、改还是放弃。但学好反思有两个难处。一是学习信号的两难:反思的价值要到任务最后才显现,所以基于结果的强化学习给反思的监督又稀疏又滞后;可一旦给反思设中间奖励,又会被钻空子,模型为了奖励反复做无意义的反思。二是局部-全局视角差:反思是在当前分支的局部上下文里做的,但它有没有用取决于整条轨迹的结果,局部反思看不到全局。

方法

LoongReflect(北大)把反思定义成记忆控制策略,不再是放任的自由文本。智能体在一个可回溯的轨迹树上跑,带两个控制动作:

只有活动路径和压缩后的记忆参与生成,被废弃的分支留在树里供诊断用,不污染后续决策。

训练用两条互补通道,经「前看」协调:

结果

在 HotpotQA、2WikiMultiHopQA 上训练,七个问答基准上评测。

模型平均 F1较 AgenticRAG-R1
Qwen2.5-3B46.15+12.60
Qwen2.5-7B49.21+12.61

每个基准都第一。域外泛化同样涨:3B 上域内从 38.46 到 52.09,域外从 31.59 到 43.77。还能迁移到不用检索的数学推理,MATH 56.0、GSM8K 82.4,但涨幅小(分别 +1.2、+1.8)。

消融说明两个动作和两个通道缺一不可:去掉 reflect 平均 F1 掉 15.31,去掉 backtrack 掉 13.06;去掉慢通道掉 7.04,去掉快通道掉 5.64,去掉前看协调掉 4.94。训练阶段上,纯 SFT 只涨 4.43,两通道 RL 再涨 11.39,大头来自 RL。这套方法只用了 600 条 SFT 轨迹、100 个 RL 外层步。

为什么重要

给做搜索/工具型智能体的人一套「教模型学会反思和回头」的训练方法,而不是只在推理时加一句提示。可回溯的轨迹树让模型能从错误分支恢复,这对多跳问答、长程规划类任务很关键。迁移到数学(无检索)涨得不多,说明这套反思技能主要还是服务于带检索的长程搜索。

局限与存疑

作者自承:依赖检索质量和控制器的检查点判断,检索噪声会污染「已验证状态」的构建,早期诊断错了会顺着后续传播;用归一化精确匹配当奖励会低估语义等价别名;可回溯多轮搜索加三快一慢的前看更新增加推理和优化开销;实验范围有限(两个训练集、七个问答、两个数学、单一种子配置)。还要补一句:基线里 Mem1、AEPO、ARPO 在这套设置上偏弱,+12.6 的大涨有一部分是踩着弱基线;3B/7B 这种规模上的结论能不能外推到更大模型没验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读