HERMES 用可执行 Dev-Primitives 提升 SWE agent 成绩 12.4%
Haibo Jin · hf · 2026-10-07
HERMES 提出 Dev-Primitives(开发原语)抽象,解决现有终端型 SWE agent 在长周期任务中的脆弱性:反复重建散落在源码、配置、测试与运行时中的程序状态,导致上下文爆炸与语义漂移。
核心设计
- 每个 Dev-Primitive 将仓库工件与一个常驻 LLM 配对,赋予其基于自身实现与依赖的 agent 原生接口,支持自然语言推理、组件间通信与局部自修改
- 依赖感知的动态激活机制按需实例化原语
- bug 诊断机制将执行证据映射回需修改的组件
结果
- 在四个软件工程基准上平均超越匹配基线 harness 12.4%
- 即使 Dev-Primitives 用 Qwen3-8B,HERMES 在全部四基准上仍与全 GPT-5.6 Sol 配置差距 4.5% 以内,同时在 Terminal-Bench 4.0 上降低推理成本 26.2%
- 结论:harness 设计对 SWE agent 性能至关重要
「编程与Agent」频道最新
- Proofpress 给 AI Agent 研究装证据账本:发现撤回,下游结论自动失效 — tallmetommy · 2026-10-07
- 给 Sonnet 接上历史工具:300k token 记忆可随时检索 — repligate · 2026-10-07
- 高通投机执行法:端侧语音助手响应延迟中位数降至 4.60 秒 — Qualcomm-AI-Research · 2026-10-07
- Sentry 创始人吐槽 ChatGPT 会话超长强制重来,直指远程压缩被厂商垄断 — zeeg · 2026-10-07
- Steve Yegge 力挺 Beads:agent 记忆系统下载量破 150 万,将升级记忆与协议 — Steve_Yegge · 2026-10-07
- 保姆级教程:用一队自主 AI Agent 跑通真实品牌的社媒投放 — ifioknkem · 2026-10-07