让第二个模型审批工具调用,监督 agent 执行轨迹

corbtt · x · 2026-07-24

被引观点提出了一种简单的 AI agent 安全模式:在工具调用之间加一个第二个模型实例,由它来审批动作、回看当前轨迹,并给主模型反馈。

这套思路强调,审查模型应当拥有不同的提示词,且不以满足用户目标为目标,从而充当独立的安全层。作者把它调侃成“从第一性原理重新发明公司官僚体系”,但认为这是件好事。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →