换 harness 不换模型,GPT-5.6 仓库迁移成绩从 6.5% 飙到 31%
omarsar0 · x · 2026-10-09
ELI5 论文作者发现 harness(智能体工程脚手架)被严重低估:在同一模型、同等 effort 设置下,仅把 Codex 换成 HERMES harness,GPT-5.6 Sol 在整仓库迁移任务上的成绩就从 6.5% 提升到 31.0%。
- 设计:HERMES 为每个仓库组件配一个驻留 LLM,它了解该组件自身代码与依赖;依赖感知步骤决定激活哪些组件,诊断步骤把测试失败映射回需要修改的组件。
- 成绩:在四个软件工程基准上平均超出同条件基线 harness 12.4 分。
- 省成本:用强激活/诊断模型搭配 Qwen3-8B 组件,成绩距全 GPT-5.6 方案仅差 4.5 分,且 Terminal-Bench 4.0 推理成本降低 26.2%。
结论:harness 工程是被低估的方向,"自己搭 harness"值得重视。
「编程与Agent」频道最新
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- 实测 AI Agent 网站准入难:16 个 subreddit 已封 7 个 — lulzxdxdxd · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- 架构师分享:用 WhatsApp 语音搭建个人 AI 管家 — No_Kangaroo_4454 · 2026-10-09
- AI 工作台密集上新:多人协作、交互仪表盘、记忆与技能 — heyneighbor · 2026-10-09
- 微软 ThinkingBox 基准:Kimi 一次通过率最高,20 连胜仅 13% — tuhin_k · 2026-10-09