同一模型换 harness 成绩差 17 个点,360 次运行实测对比
stuffyokodraws · x · 2026-09-03
- 观澜团队发布 FrontierHarness 评测:核心结论是一年前大家问的是"选哪个模型",现在变成了"选哪个 harness"。
- 测试条件:Pi、Exo、Claude Code、Codex、DeepSeek Harness 等 12 个 harness,同一模型、同一任务、同一运行环境,共 360 次运行、20 亿 tokens。
- 结果:通过率从 50% 到 67% 不等;单次通过成本差距更大,从 $1.05 到 $18.34——说明在 agent 时代,工程框架的选择对效果和成本的影响不亚于模型本身。
「编程与Agent」频道最新
- Fable 5.1 发布未满 24 小时:好评如潮但额度烧得飞快 — JosephJacks_ · 2026-09-03
- 用 Azure Bicep 部署 Foundry 模型路由器 — adnan_hashmi · 2026-09-03
- Code Arena 上线 WebDev Pareto 前沿视图,按性价比排 AI 编码模型 — arena · 2026-09-03
- 30k Star 开源 reverse-skill:让 AI Agent 按规则路由 44 个逆向渗透技能 — alex_verem · 2026-09-03
- Copilot CLI 恢复会话丢失自定义 agent,MCP 服务器与工具白名单失效 — mahirhir · 2026-09-03
- Agentic DevOps 设想:AI agent 自动排查生产事故并决定下一步动作 — Pavan_Belagatti · 2026-09-03