Reverse-Harness:按风险治理的运行时自取工具,基准从 6% 提到 61%
Rameswaranmohan1993 · reddit · 2026-09-09
作者用四个月做的开源(MIT)项目 Reverse-Harness,思路与传统 agent 框架相反:不预先塞固定工具集,而是让运行中的 agent 在缺能力时主动请求补齐,由“Governor”按风险仲裁。
核心机制
- agent 遇到能力缺口时发出 REQUESTHARNESS,请求补齐所需工具
- 复用已有工具自动放行;生成新代码必须升级到人类审核(先看规格、再看源码)
- 依赖安装单独设门禁,杜绝静默 pip install
- 新工具首次执行也被标记为“危险直到被证明安全”;所有授权都是租约制、有日志、可一键撤销
两个非显然的设计
- agent 自己申请的能力比预置的更危险(因为是它选的),所以门禁更严而非更松
- LLM 评审只能向安全方向降级:可以拒绝或升级,绝不能越过策略授权
实测
179 次试验、5 个模型/5 家厂商、任务设计为不补能力就不可能完成、外部 oracle 评分:冻结工具集 6%,受治理的按需拉取 61%(McNemar p = 2.8e-10)。作者坦承小模型写工具质量差、安装偏重、评测是自己做的欢迎被打破。
「编程与Agent」频道最新
- 开源 qacman:把二维码做成可玩的吃豆人迷宫 — ezshine · 2026-09-09
- managed-deepagents 0.7 推出 Managed Connections,一个参数搞定 Agent OAuth 授权 — BraceSproul · 2026-09-09
- Meta 发布个人 Agent Muse:隔离沙箱+Sentinel 拦截层守护安全 — rohanpaul_ai · 2026-09-09
- 用几条 Prompt 生成视频:开发者开源 HTML/CSS 视频模板库 — round · 2026-09-09
- ICML 2026 最佳论文「LLM 记忆了多少数据」被 AI 实习生以不到 8 美元复现 — _akhaliq · 2026-09-09
- OpenAI 研究员人均日烧 600 美元 token,编码 Agent 席卷前沿实验室 — downingARK · 2026-09-09