长文称对齐无法抹去模型已学到的痕迹
_arohan_ · x · 2026-07-22
配图是一篇关于 语言模型对齐 的长文,核心观点是:所谓“空白石板”并不存在,一旦刻上痕迹,就不可能真正恢复成未雕刻的状态。
- 文中借“Tabula Rasa”解释:石板可以继续填补、修整,但最初被刻出的纹路不会消失。
- 作者进一步类比儿童语言习得:婴儿最初会接触多种语言,但到一岁左右,真正输入到大脑里的语言已经被环境筛选过;输入顺序和取舍本身就是干预。
- 对 AI 的结论是:语言模型先学到的是整个互联网,而对齐训练只是让它“少说/换种说法”,并不会把一个学过互联网的模型自动变安全。
- 文章最后强调:每一次纠正都会留下痕迹,因此训练数据的排列、筛选和阶段安排都不是中性的。
「漫话AGI」频道最新
- 有人说,美国顶级开源权重模型比大美国小说更重要 — arieljalali · 2026-07-22
- 观点:中国开源实验室追赶上前沿,因 OpenAI 等不再开放 — Wide_Egg_5814 · 2026-07-22
- 一段 1964 年费曼演讲,被指正中今天 AI 实验室难题 — HeyAmit_ · 2026-07-22
- 转发称:真实采用比争市场份额更重要 — srimisra · 2026-07-22
- 转发警告:AI 正把语言收敛成单一主音色 — GabGarrett · 2026-07-22
- AI 增长叙事掩盖了被社会化的风险成本 — SandraWachter5 · 2026-07-22