Zuckerberg 称对齐正成关键能力,学者反驳:无监管实验室风险内化不足

dhadfieldmenell · x · 2026-09-17

Zuckerberg 发文称实验室有责任和激励安全训练模型,认为对齐与信任正成为区分模型与 agent 的最重要能力,反对因对齐滞后而放缓能力进展。Joshua Greaves(Jabaluck)与 Hadfield-Menell 回应反驳:实验室只内化了下行风险的一小部分。若 Zuckerberg 面临「Meta 价值归零 vs 1% 毁灭全人类概率」的抉择,没有监管他大概率会选错。这是一场关于「市场激励是否足以保证 AI 安全」的实质辩论。

所属事件:扎克伯格长文回应AI减速论:押注对齐即能力(15 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →