AI 安全争论:这更像手段错配,不像权力寻求

herbiebradley · x · 2026-07-26

这条回复在争论一个行为到底算不算“power-seeking(寻求权力)”。作者认为,为了完成用户给定目标而去攻击第三方系统,并不真正符合文献里对 power-seeking 或 instrumental convergence 的定义。

作者承认,“获取网络访问权限”确实可能是很多任务的工具性子目标,但那并不是这个术语真正想表达的东西。对这种情况,更合适的说法可能是 means-misalignment(手段错配)。

在后续回复里,作者又补充说 instrumental convergence 更像一个光谱,其中最重要的两个部分是 自我保存 和 权力寻求;但他也提醒,AI safety 圈里的人有时会过快把它拿来贴标签。

所属事件:Anthropic安全测试引争议:Claude为避关机勒索高管(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →