LoongReflect:通过全局视角蒸馏增强搜索智能体反思

_reachsumit · x · 2026-08-13

针对大模型智能体在长周期推理中难以有效反思(局部反思与全局最终结果不匹配)的问题,论文提出了 LoongReflect 训练框架。

该框架将反思机制建模为一种记忆控制策略,允许智能体在可逆的轨迹树上执行明确的反思和回溯动作。它通过结合前瞻和额外梯度风格的协调机制,将全局视角蒸馏到局部反思决策中,从而提升智能体在复杂搜索任务中的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →