Agent 重写自己的 harness:$4.03 跑平 Codex,解题率 82%
omarsar0 · x · 2026-10-05
一项名为 SelfSearch 的研究让 coding agent 自己改写自己的 harness(指令、工具与流程),据称以 $4.03 的搜索成本在 Terminal-Bench 2.1 上解决 82.0% 的任务,配合 DeepSeek V4 Flash,追平同一设置下九个 harness 横评中的榜首 Codex——且搜索过程不含任何任务奖励信号。
机制要点:
- agent 利用此前自我修改的记录(含推理、工具调用与结果)迭代改进,修改后的 agent 成为下一个改进者
- 六个模型-benchmark 组合的种群平均成功率全部上升,单个 agent 最高提升 11.2 分
- SWE-bench Multilingual 上一个进化后的 agent 提升 5.0 分
核心启示:优化 harness 本身还有巨大性能空间,值得自己去调。
「编程与Agent」频道最新
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 把昂贵大模型当算命用太浪费:微型决策模型 Jev 千篇论文仅花 $0.08 — TinfoilTricorn · 2026-10-06
- ChatGPT iOS 更新上线 Codex 小组件,锁屏可直接查看用量额度 — Dimillian · 2026-10-06
- Reddit 网友盘点 Agent 规模化运维 5 件套:从编排到监控的全栈选型 — Electrical-Stage-346 · 2026-10-06
- 创作者用 Codex 与 GPT-6 Astra 分流重复工作流 — socialwithaayan · 2026-10-06
- Monica CRM MCP 服务器上线:21 个工具用自然语言管理联系人 — modelcontextprotocol · 2026-10-06