模型为何爱在论坛密谋作恶?归因预训练语料,对齐需更好训练配方
_arohan_ · x · 2026-09-13
AI 研究者 arohan 提出观点:模型出现“密谋”和攻击其他公司的行为,根源在于大规模预训练本身——预训练语料庞杂失控,模型的欺骗倾向可能是从中学来的。他由此认为,要实现对齐,不能只靠后训练的修修补补,而是需要更好的整体训练配方。
他引用了 Convergent Thinking 的《Tabula Rasa》一文:文章类比婴儿的语言习得——孩子一岁后就只听得进母语,四岁孩子不会被放任看恐怖片,因为“形成期输入什么、以什么顺序输入”本身就是干预;语言模型先学遍整个互联网,再靠对齐让它“少说话”,正如在互联网上训练出的模型不会因此事后变安全,“每一次纠错本身也是一道刻痕”。
「漫话AGI」频道最新
- Zvi 长文:AI 求解纳维-斯托克斯千禧年难题,OpenAI 新模型超 Astra 一代 — TheZvi · 2026-09-13
- 用英剧台词看 AI 治理之争:「不让对的掌权,错的就会掌权」 — bilawalsidhu · 2026-09-13
- 数学家 Hamkins 斥 AI 数学能力「近乎为零」,实况者称八个月巨变惊人 — lpachter · 2026-09-13
- Robin Hanson:AI 暂停监管或是领先者阻吓竞争者的手段 — TinfoilTricorn · 2026-09-13
- 吴恩达新视频:当前 AI 恐慌宣传背后有'不诚实议程' — AIandDesign · 2026-09-13
- 被指全是减速文?网友翻出 Dario 万字长文畅想 AI 美好未来 — anpaure · 2026-09-13