靠「哪些内容进预训练」来做对齐形同巫术,tszzl 称必致失败

repligate · x · 2026-10-05

tszzl 发推警告:如果未来超级智能的安全要依赖「哪些想法能进入预训练数据」这种脆弱的方法,那我们都会死。他认为这更像巫术而非工程,不能作为未来模型安全的基础。

DahliaOhara 与 repligate 转发表示认同:DahliaOhara 指出坏想法无法对已掌握我们所有思想的心智隐藏;repligate 引用强调,靠数据侧过滤来做对齐根本靠不住。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →