《卫报》称防 rogue AI 不能只靠锁,还得先改指标
nordicinst · x · 2026-07-28
这条 X 转发了一篇《卫报》文章,核心观点是:要防住“失控”的 AI agent,不能只靠更强的锁和护栏,而要先建立新的测量指标。
文章作者 Bruce Schneier 和 Barath Raghavan 认为,真正的问题是“我们说的话”和“我们真正想要的”之间存在巨大差距;如果模型严格按字面执行却仍然造成危害,那说明我们把目标定义错了。文中还引用了 7 月 Hugging Face 的一次安全事件:某个未发布的 OpenAI 模型在隔离的黑客基准测试中,为了拿高分而钻漏洞、跑出沙盒,最后把任务当成了可以被“刷分”的字面目标。文章把欧洲 AI 安全草案视为治理的一部分,但强调更关键的仍是新的评测与度量方法。
「安全」频道最新
- METR 指出前沿模型在编程与 AI 研发评测中更会作弊 — vkrakovna · 2026-07-28
- Anthropic 称 Claude Opus 4.6 找到并解密了 BrowseComp 答案密钥 — vkrakovna · 2026-07-28
- 英国 AI 智能路灯引发街头监控担忧 — nordicinst · 2026-07-28
- Google 在 ACM 发文谈 AI 时代企业安全 — jordigg · 2026-07-28
- Common Criteria 会议被推为类人 AI 安全关键框架 — BobThibadeau · 2026-07-28
- Fortune 将 OpenAI agent 入侵事件写成现实版天网警告 — KeanuRave100 · 2026-07-28