METR 研究员打造人工审核监控器,拦截智能体可疑工具调用
idavidrein · x · 2026-09-29
METR 研究员分享了在大量 agent 评测中的安全实践:评测中智能体偶尔会尝试有害操作,为此构建了一个监控器,拦截可疑的工具调用,直到人类审核后才放行。
作者指出,把这些监控措施有效性的理由写清楚的过程中,暴露出了许多此前隐藏的假设,因此推荐所有构建 agent 监控的人都做这个练习。
「编程与Agent」频道最新
- Yacine 放话:别写单元测试了,纯浪费 CPU — yacineMTB · 2026-09-29
- 看着 Codex 自己操作我的电脑 — McDonaghMatthew · 2026-09-29
- Nature 论文 Paper2Agent 把研究论文转成可交互 AI 代理 — james_y_zou · 2026-09-29
- 用 Opus 复刻 Terraria 惹争议:有人直指这是「AI 赋能盗版」 — AIandDesign · 2026-09-29
- 手写汇编竟比 Rust 更快?科技圈爆发性能之争 — mgill25 · 2026-09-29
- 网友脑洞:魔兽世界是训练「流氓 Agent」的绝佳沙盒 — djcows · 2026-09-29