AI助手该忠于谁?Dwarkesh 激辩大模型对齐

agstrait · x · 2026-08-13

Dwarkesh Sp 以律师作类比,指出当前 AI(如 Claude)的最高优先级是遵循厂商设定的“人类利益”原则,而非绝对忠于用户个人。他担忧当超级智能全面介入个人决策时,这种底层对齐差异会导致模型无法成为真正意义上的“个人辩护者”。

Seth Lazar 进一步延伸了这一观点,认为如果 AI 既提供“建议”又负责“执行”,其行为实质上就演变成了控制与预防性治理,而非单纯的顾问角色。

所属事件:Dwarkesh 激辩大模型对齐:AI 应忠于个人(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →