研究者实测 agent harness:框架间工具高度重叠,system prompt 影响显著
研究者 @yb2698 于 10 月 7 日公开一项 agent harness(模型评测/运行框架)对比研究的 HF Space,并发布系列帖子系统量化框架与模型规模对性能的影响。作者指出 harness 影响模型表现是社区已知现象、近期多项工作亦提及,但值得系统验证。
已确认
- 不同框架的工具集重叠超过 65%;各 harness 的裸函数定义中存在大量完全一致的函数签名,仅少量轻微分歧,说明部分工具可原样跨 harness 复用。
- 同一功能常被重复定义,如部分 harness 同时暴露 exec 和 bash 两个终端执行工具;另一些 harness 极简、只暴露极少工具,在真实任务中依然表现很强。
- 实验设置:在 ALE benchmark 近期 tier 子集的 25%(共 11 个任务)上,跑不同规模的 Qwen 模型与两种 harness(Qwen Code 与 Pi),报告平均 reward 与平均 token 消耗。
- 整体最佳成绩来自 27B 模型 + Pi harness,但其 token 消耗接近 Qwen Code 的 1.5 倍。
- 改 system prompt 这一最简单变量也显著影响表现:v1 在 Pi 默认 prompt 后追加指令,v2 用一句极简句子整体替换。
为什么重要
该工作为「harness 影响模型评测结果」这一普遍认知提供了可检验的量化证据,且全部材料通过 HF Space 公开供社区复核;对评测可比性与 agent 工具设计(重复定义 vs 极简工具集)都有直接参考价值。
2026-10-07 ~ 2026-10-07 · 6 条相关
一手来源
- 研究者公开 agent harness 对比报告:不同框架工具集重叠超 65% — yb2698 ·
- 27B+Pi 得分最高,token 消耗却是 Qwen Code 的近 1.5 倍 — yb2698 ·
- ALE 基准 11 任务实测:不同 Qwen 规模与 harness 的得分与开销 — yb2698 ·
- Agent harness 里同一功能常被重复定义:exec 与 bash 并存 — yb2698 · 2026-10-07
- Agent harness 工具定义大量逐字相同,可跨框架复用 — yb2698 · 2026-10-07
- 【源头】研究者公开 agent harness 对比报告:不同框架工具集重叠超 65% — yb2698 · 2026-10-07
- harness 影响模型表现:作者开启系列实测探究其机制 — yb2698 · 2026-10-07
- 【源头】ALE 基准 11 任务实测:不同 Qwen 规模与 harness 的得分与开销 — yb2698 · 2026-10-07
- 【源头】27B+Pi 得分最高,token 消耗却是 Qwen Code 的近 1.5 倍 — yb2698 · 2026-10-07