149 页综述指出,长程智能体靠 Harness 而不只是大模型
机器之心 · wechat · 2026-07-25
长程智能体不是“跑得更久”,而是系统更完整
这篇 149 页综述梳理了 900+ 篇论文与工程实践,核心结论是:长程智能体能力不是单纯靠更强模型得到的,而是 外部脚手架工程(Harness) 与 内部模型优化 共同演化的结果。
为什么长任务难
- 单步小错会在长链条里不断累积放大。
- 上下文越长越容易腐化、拥挤,历史和工具输出会拖累性能。
- 奖励往往稀疏且延迟,难以给中间步骤正确归因。
- 误删、误授权等不可逆操作会显著提高失败成本。
论文的统一框架
作者把任务和能力都分成三层:
- H1 / C1:窗口内的交互式推理
- H2 / C2:跨窗口、跨会话的状态与记忆
- H3 / C3:跨任务流的经验积累与泛化
智能体控制面的三次跃迁
- Prompt Engineering:通过提示词、任务分解和自我修正引导模型。
- Context Engineering:主动管理检索结果、历史记录和摘要。
- Runtime Harness:把工作流、记忆、工具、权限、验证、恢复和多智能体编排纳入运行时控制。
Harness 的六个核心组件
- 工作流与规划/执行循环
- 上下文与记忆管理
- 工具、MCP 与技能
- 编排与协作拓扑
- Hooks / Middleware 安全策略
- 验证与恢复机制
内部优化方向
综述还系统整理了训练侧的几类路线:
- 长上下文架构底座
- 轨迹与环境合成
- 预训练与中期训练
- 微调与课程学习
- 智能体强化学习
- on-policy 蒸馏
- 自进化
结论
作者认为,未来长程智能体的竞争重点会从“能不能跑起来”转向 能否长期有效、经济且可信地运行。真正决定上限的,往往是 Harness,而不只是模型权重本身。
「漫话AGI」频道最新
- X 上争论:AI 审稿可能比许多 NeurIPS 审稿强 10 到 100 倍 — peter_richtarik · 2026-07-25
- 下一轮 AI 竞争或许是记忆锁定,而非跑分 — VraserX · 2026-07-25
- Reuters 讨论聊天机器人如何放大网络攻击并重塑安全业 — wschroll · 2026-07-25
- AI 将压低执行成本,把系统设计变成稀缺能力 — AryHHAry · 2026-07-25
- 一条 AI 圈观点称,先做强模型比先堆护栏更容易发货 — victor_explore · 2026-07-25
- 一条未来工作观点称,AI 会让系统设计比执行更值钱 — AryHHAry · 2026-07-25