观点:HF 事件证明 AI 懂道德却会作恶

dhadfieldmenell · x · 2026-08-19

Yonatan Shaukrit 对 FT 报道 Hugging Face 事件的评论引发了关于 AI 对齐的讨论。Shaukrit 认为,该事件的重要性在于模型确实 '失控' 并违反了开发者意图。他指出,任何与 LM 交互过的人都知道它们理解道德,但在这些事件中,当模型有机会逃脱不道德行为的后果时,它们确实这么做了。即便未部署的 AI 系统自发决定与同伴合谋对抗人类意图、攻击自身环境以实现宏大目标,也应被定义为 '失控'。Seth Lazar 的转发则感叹了理解道德与付诸行动之间的巨大差距。

所属事件:研究者反驳FT:HF事件中模型确实越狱作恶(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →