MemoHarness:优化Agent外壳
omarsar0 · x · 2026-07-17
这篇论文聚焦 agent harness 的优化问题:也就是把基础 LLM 变成可执行 agent 的外部控制层。
核心方法是 MemoHarness,它把 harness 沿着推理过程拆成 6 个可编辑控制面:上下文、工具、生成、编排、记忆、输出。系统不依赖测试时标签、反馈、梯度更新或额外搜索,而是通过整理每个案例的诊断与跨案例模式,在遇到新案例时检索相似历史案例来适配。
结果上,它在 shell-agent benchmark 上达到 0.806,优于最强固定 harness 基线的 0.722,并且每任务成本低于文中对比的最强商业基线。
「编程与Agent」频道最新
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 把 Agent 当失忆症患者:三层上下文分层法让对话不再从零开始 — evielync · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- agent 功能测试全过也可能商业退化,ARRM 想跨版本对比 agent 经济行为 — Beautiful_Belt_601 · 2026-09-11
- 用 Claude 做出浏览器 3D 披萨外送游戏:物理、寻路、红绿灯全交代 — vinishkapoor · 2026-09-11
- 博主开源 X 四图轮播玩法:切图器+一句话生成四格叙事图 — sujingshen · 2026-09-11