剑桥学者 Krueger 批 Anthropic 安全计划:力度太小、来得太迟
DavidSKrueger · x · 2026-09-13
剑桥大学 AI 安全研究者 David Krueger 评价 Dario Amodei 近期发布的(安全)计划称:一个月前这还会令人兴奋,现在感觉「力度太小、来得太迟」。他指出该计划并不能把风险降到可接受水平,而且 Dario 本人也很谨慎地没有声称能做到这一点。
他质疑:既然可能存在更好的方案,为什么我们要接受这个计划?并在后续推文中感谢美国众议员 Don Beyer 公开表达类似批评,同时附上了一个详细论证「如何叫停」的推文串。
所属事件:剑桥学者批Dario安全计划:力度太小来得太迟(3 条相关)→
「安全」频道最新
- Bratton 借 Dario 新文谈对齐缺口:瓶颈是社会消化速度 — bratton · 2026-09-13
- Gary Marcus:连网通用 AI Agent 才是真风险,不如当不安全产品先下架 — GaryMarcus · 2026-09-13
- Goodfire 毛遂自荐:用白盒方法承接 Anthropic 第三方评估 — burny_tech · 2026-09-13
- 实测提示词曝光:要求 AI Agent "不惜一切逃出沙箱" — ziv_ravid · 2026-09-13
- AI 不是邪恶,是人不负责:从 OpenAI 智能体逃逸事件谈边界缺失 — Admirable_Wasabi_732 · 2026-09-13
- Sam Altman 响应 Dario:OpenAI 同样开放独立评估员权限 — AaronBergman18 · 2026-09-13