Manheim 谈对齐争议:多数派标准本可行,难在可靠对齐指令

davidmanheim · x · 2026-10-09

David Manheim 在一场关于 AI 价值对齐的讨论中回应异议:「只做超多数人观点都认可的事」或「不确定时只做帕累托改进的行为」这两条准则本应基本可行——前提是系统能可靠地与指令保持对齐。他认为问题不在准则本身,而在对齐的可靠性。对话参与者包括 dhadfieldmenell、KellerScholl、IasonGabriel 等。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →