字节 Seed 论文 HarnessDev:给自建 harness 的智能体打分而非只看任务
omarsar0 · x · 2026-09-02
ByteDance Seed 的 HarnessDev 论文提出评估自进化 agent harness 的新范式:不再按模型完成的任务打分,而是评估智能体自己构建的执行系统。
方法:
- 智能体从一个弱但可运行的 seed 与少量样例出发,搭建完整执行系统
- 第二阶段将 harness 交回,根据下游反馈迭代改进
- 两个阶段同时按能力与执行 token 成本打分,兼顾效率与花费
实验:覆盖 6 个 creator LLM、4 个领域、2,207 个 held-out 下游实例。
结论:生成的 harness 在代码、搜索与研究领域明显落后于成熟的人工工程版本,但在写作与 ML 实验领域持平甚至超越。自进化效果呈现明显的领域分化。
所属事件:字节 Seed 发布 HarnessDev:让智能体自建并进化执行框架(2 条相关)→
「编程与Agent」频道最新
- Obsidian 新玩法:QuickAdd 一条命令随手捕获待办任务 — dSebastien · 2026-09-03
- Sergey Karayev:Fable 5.1 是我用过最好的编程模型,快且不怕长会话 — sergeykarayev · 2026-09-03
- Software World:用智能体运营的「GitHub」,多 agent 协作优化 Python 依赖链 — ZimingLiu11 · 2026-09-03
- 南大 Specula 用 Claude Code 自动生成 TLA+,已挖出 382 个深层并发 bug — jiqizhixin · 2026-09-03
- AI agent 替用户网购球衣:13 分钟下单,但也留下隐患 — jeff_weinstein · 2026-09-03
- Hands-On AI Engineering 开源仓库:3k 星,覆盖 RAG、OCR、多智能体实战代码 — tom_doerr · 2026-09-03