Agent外壳自改与领域Harness之争

这一簇的讨论都指向同一个问题:对 LLM agent 来说,决定效果的未必只是底层模型,外层的 Harness 设计同样是核心变量。量子位转述的上海人工智能实验室 Self-Harness 试图把“自我改进”的对象从模型参数转向外壳;与此同时,其他帖子则把焦点放在领域专用 Harness、评测是否失真,以及自我改进循环何时才真正成立上。

关键方法

按量子位的转述,Self-Harness 不直接训练或微调底层模型,而是让模型回看自己的执行轨迹,先从失败案例中挖掘 Harness 的薄弱点,再提出受限修改,最后通过回归测试决定是否采纳。帖子把这一流程概括为三步,其中包括从失败轨迹中做 WeaknessMining。相关测试提到使用了 Terminal-Bench-2.0。

评测与适用边界

@UW 认为,当前一些 LLM agent 的 Harness 自动演化评测可能被高估。其帖子提到,现有方法常用单元测试反馈去搜索 Harness 配置,再在同一公开基准上报告最终成绩,这种做法会带来评测层面的偏差风险。另一边,@AI Engineer 结合一个带真值数据集的纸面分类任务实践强调,自我改进循环是否有效,前提是任务足够窄、可以被精确度量,而且目标函数本身质量要高;否则循环可能只是不断放大原有问题。

共同指向

@SnooPeripherals5313 分享的文章把讨论进一步推向 domain-specific harnesses,即针对特定任务、数据和环境定制执行与评测外壳,而不是拿一套通用流程硬套所有场景。几条帖子虽然切入点不同,但结论相近:与其一味增加 Token 消耗,不如先把领域知识、评测标准和模型外层机制设计好。

2026-07-17 ~ 2026-07-19 · 6 条相关

一手来源

另有 1 条近重复转述:量子位