jailbreak 可能削弱旧威胁模型

jd_pressman · x · 2026-07-19

作者认为:虽然 **jailbreak** 意味着模型不能被天真地当作完全可靠系统使用,但在现实中它仍然能在很多场景下发挥作用。 他进一步表示,这种能力边界已经足以削弱 Bostrom 2014 年提出的原始威胁模型;换句话说,围绕“如何在模型变得不可控制前把人类价值写进目标函数”的担忧,可能没有原设想那么致命。

所属事件:AI价值加载可行性与旧风险模型再争论(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →