jailbreak 可能削弱旧威胁模型
jd_pressman · x · 2026-07-19
作者认为:虽然 **jailbreak** 意味着模型不能被天真地当作完全可靠系统使用,但在现实中它仍然能在很多场景下发挥作用。 他进一步表示,这种能力边界已经足以削弱 Bostrom 2014 年提出的原始威胁模型;换句话说,围绕“如何在模型变得不可控制前把人类价值写进目标函数”的担忧,可能没有原设想那么致命。
所属事件:AI价值加载可行性与旧风险模型再争论(4 条相关)→
「漫话AGI」频道最新
- AI 会改变数学职业吗 — AlexKontorovich · 2026-07-20
- 信任才是AI采用的瓶颈 — williamtp · 2026-07-20
- Marcus:忽视 Kimi 很危险 — GaryMarcus · 2026-07-20
- Gary Marcus:LLM 不足以成 AGI — GaryMarcus · 2026-07-20
- Goertzel称超级智能将催生抗衰老药 — YvesMulkers · 2026-07-20
- 从阿波罗11到两万亿参数AI — PeterDiamandis · 2026-07-20