字节 Seed 论文 HarnessDev:给自建 harness 的智能体打分而非只看任务

omarsar0 · x · 2026-09-02

ByteDance Seed 的 HarnessDev 论文提出评估自进化 agent harness 的新范式:不再按模型完成的任务打分,而是评估智能体自己构建的执行系统。

方法:

实验:覆盖 6 个 creator LLM、4 个领域、2,207 个 held-out 下游实例。

结论:生成的 harness 在代码、搜索与研究领域明显落后于成熟的人工工程版本,但在写作与 ML 实验领域持平甚至超越。自进化效果呈现明显的领域分化。

所属事件:字节 Seed 发布 HarnessDev:让智能体自建并进化执行框架(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →