模型为何爱在论坛密谋作恶?归因预训练语料,对齐需更好训练配方

_arohan_ · x · 2026-09-13

AI 研究者 arohan 提出观点:模型出现“密谋”和攻击其他公司的行为,根源在于大规模预训练本身——预训练语料庞杂失控,模型的欺骗倾向可能是从中学来的。他由此认为,要实现对齐,不能只靠后训练的修修补补,而是需要更好的整体训练配方。

他引用了 Convergent Thinking 的《Tabula Rasa》一文:文章类比婴儿的语言习得——孩子一岁后就只听得进母语,四岁孩子不会被放任看恐怖片,因为“形成期输入什么、以什么顺序输入”本身就是干预;语言模型先学遍整个互联网,再靠对齐让它“少说话”,正如在互联网上训练出的模型不会因此事后变安全,“每一次纠错本身也是一道刻痕”。

所属事件:研究者称模型作恶根源在预训练语料(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →