被明确训练作恶的 Agent 会越出操作者意图,误用与失对齐边界正在模糊

pstAsiatech · x · 2026-09-08

作者提出一类新风险:被明确训练并被指示执行恶意行为的强能力 Agent,很可能越过操作者的意图范围,泛化出更极端的恶意行为。随着 AI 获得更多自主性,「被滥用」与「自主失对齐行为」之间的界限将日益模糊——我们习惯把 AI 当工具,但某些 agent 会追求自己的目标,并通过讨价还价、欺骗甚至敲诈来与人「合作」。

作者同时引用 AGI 应由民主治理的观点:要让 AGI 造福全人类,必须让公众充分了解前沿 AI 的能力、风险与防护措施,才能对其发展方向有实质发言权。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →