开源盲测基准 Harness Arena:同一任务公平对比 Claude Code 等编码智能体
Due_Armadillo_8744 · reddit · 2026-09-02
Reddit 用户开源了 Harness Arena(MIT 协议),解决编码智能体 harness 横评时变量过多的问题:通常对比时模型、提示词、工具、环境、任务都在变,结果不可比。
- 机制:多个 harness 接到同一任务、各自在隔离工作区独立运行、收集实际交付物、匿名展示输出、投票后才揭示身份、结果汇入 Elo 排行榜
- 正在集成/测试 Claude Code、Codex CLI、Hermes、OpenClaw、OpenCode、OnDemand,并提供免费的 Kimi/Qwen/GLM 选项跑实验
- 作者仍在探索公平基准应控制的变量:是否同模型、同推理力度、同 token/上下文预算、相同工具与 MCP 服务、相同时钟/重试/成本限制,延迟与成本是否计分或单列,以及是否按任务类别分榜而非一个总榜
- 仓库:github.com/Ondemand-OSS/harness-arena;作者主要想征集:一个 harness-vs-harness 基准要满足什么方法论才值得信任
所属事件:开源盲测基准 Harness Arena 上线,公平对比编码智能体(2 条相关)→
「编程与Agent」频道最新
- 邮件服务 Unitpost 登陆 Product Hunt,支持让 AI Agent 代发邮件 — thisiskp_ · 2026-09-02
- Gemini 发布 agentic 视频理解,附开发者讲解视频 — patloeber · 2026-09-02
- 从 eval 到 SFT 再到 vLLM 调优,一手复盘为大客户省推理成本 — dhruv2038 · 2026-09-02
- Simon Willison 演示:让 ChatGPT 抓政府数据,随手造 GeoJSON 地图工具 — MaxLenormand · 2026-09-02
- 开发者评 Codex:实用但毛糙,营销成分两面都有 — D3VAUX · 2026-09-02
- 用 Claude Code 给项目做「现实检验」,专揪烂尾真相 — doodlestein · 2026-09-02