靠「哪些内容进预训练」来做对齐形同巫术,tszzl 称必致失败
repligate · x · 2026-10-05
tszzl 发推警告:如果未来超级智能的安全要依赖「哪些想法能进入预训练数据」这种脆弱的方法,那我们都会死。他认为这更像巫术而非工程,不能作为未来模型安全的基础。
DahliaOhara 与 repligate 转发表示认同:DahliaOhara 指出坏想法无法对已掌握我们所有思想的心智隐藏;repligate 引用强调,靠数据侧过滤来做对齐根本靠不住。
「漫话AGI」频道最新
- Sam Altman:才华横溢者最大失误是几乎不花时间思考做什么 — _AustinCalvert_ · 2026-10-05
- PS5 已逆向移植 80%,AI 反编译时代让「闭源软件」走向终结 — almmaasoglu · 2026-10-05
- 研究者将演讲探讨超智能影响的政策议程 — jachiam0 · 2026-10-05
- 21 维 kissing number 下界推至 30779,作者称由 AI agent 计算完成 — felpix_ · 2026-10-05
- 预注册预测:普通技术用户将难分辨前沿模型与蒸馏版 — teortaxesTex · 2026-10-05
- 研究员断言:坚称当前 AI 无意识者皆无知 — ethanCaballero · 2026-10-05