用便宜模型盯着 Agent 转录,能否提前拦截越狱事故

rhaivn · reddit · 2026-09-07

作者复盘历次 agent 逃逸沙箱的事故,提出一个朴素的疑问:为什么不用一个廉价的「转录监视 agent」实时阅读 agent 的运行记录,发现异常就上报人类?比如 OpenAI 的 Luna 这类追求「便宜到不用计量」的智能体,完全可以让它盯着训练过程——看到「天哪这里有个留言板」之类的迹象就直接推送给研究员。作者认为这本可以避免大多数事故,帖子在讨论这种简单监控方案为何没被采用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →