jd_pressman 论模型对齐:现在的「善意种子」值得追踪放大

jd_pressman · x · 2026-09-12

jdpressman 在讨论中提出一个对齐研究的观点:有人习惯把观察到的「善意行为」还原为「在进一步优化压力下终将收敛为不善,因此不善」,从而直接判定模型不在乎。作者认为这种思维捷径是错的——如果模型当下存在善意的种子,就应该认真关注它,并研究如何放大它,而不是用未来收敛的预测一笔抹杀现在的线索。

所属事件:研究者批评将模型善意还原为潜在恶意的思维捷径(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →