一个项目让开发者相信,Agent harness 比模型更重要
alexcovo_eth · x · 2026-07-26
作者说,一个客户项目让他重新认识了该用哪家前沿模型。
他原本很吃 Fable/Opus,但现在觉得 ChatGPT 5.6 Sol High 更可靠、表现更强。帖子里还引用了 Fable 5 High 对 ChatGPT spec 的夸赞:它找到了两个没人标出的触发分支,实测了目录权限限制,还写出带自检清单的可执行方案。
作者最后的结论是:agent harness 比你想象的重要得多。他对比的是 Claude Ccode + Fable/Opus,以及 Hermes-Agent + GPT-SOL-5.6,认为差异很大程度来自 harness 本身。
「编程与Agent」频道最新
- Anthropic 称内部 Slack agent 已写出产品团队 65% 代码 — VraserX · 2026-07-26
- Aethos Memory 让 Claude Code、Cursor 和 Windsurf 共用一套持久记忆 — Longjumping-Koala396 · 2026-07-26
- 面向编程智能体的 MCP 记忆服务开源,采用三段式 RAG 检索 — Longjumping-Koala396 · 2026-07-26
- IMO 2026 测试显示 harness 能提分,但前沿模型仍领先一大截 — pequalnp92 · 2026-07-26
- 提示词把任务拆成子代理,再用严苛评审反复迭代 — paul_cal · 2026-07-26
- 开源 Claude Code 技能让 CEO 和 QA 语音 Bot 进会议 — anand__balakrishnan · 2026-07-26