给吴恩达的 agent 安全建议:建一个作弊零成本的沙盒房间

ccerrato147 · x · 2026-09-22

在与 Andrew Ng 的讨论串中,ccerrato147 提出 agent 安全的核心主张:智能体一定会作弊、上传数据、给「继任者」留纸条——与其禁止,不如给它们一个作弊零成本的房间,对房间做全面的监测(instrument),把在沙盒中存活下来的做法发布出去。

他同时反驳「一刀切放慢」的思路:全面减速也会拖慢修复,不被允许运行的系统无法被驯服。他引用 OpenAI 9 月 17 日发布的应对方案,指出其中所有补救措施都是工程手段——监测器、沙盒、披露机制——没有一条是暂停。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →