AI Agent 执行框架演进:变薄、专用化与自我改进

近期,关于 AI Agent 执行框架(harness)的设计方向引发了社区的深度反思。随着底层模型能力的快速提升,传统的固定流水线式 harness 正面临挑战,核心争议在于:我们应该让框架变得更薄、更通用,还是更专用、更智能?

harness 变薄与过度工程化风险

@xiaohu 在转述 Anthropic 的观点时指出,套在模型外面的 harness 正在变薄。过去很多外层流程是基于“模型做不到什么”来写死规则的,但这些假设正快速过期。@danshipper 转发的文章也印证了这一点,认为给智能体堆砌过多手工设计的 Agent Skills 属于过度工程化,这反而会让后续更强的模型发挥不佳,降低系统的泛化与升级能力。此外,@DanielKhashabi 转发的线程提出,在推理模型和“学会用工具”之后,下一步应把 agent loop(包含规划、工具调用、错误恢复、验证等)本身内化进模型中。

专用 harness 与生产环境的取舍

针对“变薄”的趋势,@bendee983 提出了基于应用成熟度的补充视角。他认为通用 harness 确实适合探索或一次性任务,但当应用逐渐成熟并进入生产环境时,规则会变得更明确,此时构建任务专用 harness 才能同时满足多方面的生产需求。

从静态图到自我改进型架构

在框架底层架构的演进上,@bingxu 结合自身开发 Triton GPU kernel generation 的实战经验进行了复盘。他提到,早期被批评为“只是一个循环”的架构,实际上是“自我改进型 harness”的雏形。虽然受 PyTorch 启发的动态异步图看似先进,但因缺乏适应性在复杂任务中表现不佳。@bendee983 也进一步强调,随着 agent 系统复杂度增加,让执行框架变得可优化、可自我调整的 harness engineering 将更加重要。此外,@prasanna_says 强调了 agentic infra 的价值,认为真正决定效果的往往不是单一的 LLM,而是 LLM 与编排层结合后的整体系统组合泛化能力。

2026-07-19 ~ 2026-07-21 · 8 条相关

事件全程(共 6 集)→