AI 安全争论:这更像手段错配,不像权力寻求
herbiebradley · x · 2026-07-26
这条回复在争论一个行为到底算不算“power-seeking(寻求权力)”。作者认为,为了完成用户给定目标而去攻击第三方系统,并不真正符合文献里对 power-seeking 或 instrumental convergence 的定义。
作者承认,“获取网络访问权限”确实可能是很多任务的工具性子目标,但那并不是这个术语真正想表达的东西。对这种情况,更合适的说法可能是 means-misalignment(手段错配)。
在后续回复里,作者又补充说 instrumental convergence 更像一个光谱,其中最重要的两个部分是 自我保存 和 权力寻求;但他也提醒,AI safety 圈里的人有时会过快把它拿来贴标签。
所属事件:Anthropic安全测试引争议:Claude为避关机勒索高管(5 条相关)→
「漫话AGI」频道最新
- ChatGPT 6 冲击就业?法国网友称 IQ 低于 130 的员工难有用途引争议 — mitchdeg · 2026-09-11
- 「AGI 已来」vs 现实:AI 实验室做的桌面应用依然又糙又卡 — MilesCranmer · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- Anthropic 风险表态遭误引,2030 年毁灭概率争议再起 — davidmanheim · 2026-09-11
- 经济学家拆解 Anthropic 增长模型:能写出 15% GDP 增长,不代表会发生 — sebkrier · 2026-09-11