对齐本质是泛化问题:ML 默认就在做对齐研究

akbirthko · x · 2026-09-25

作者 @akbirthko 提出观点:对齐问题常被 safety 圈理解反了——对齐本质是泛化问题,即让模型从少量对齐数据/环境泛化到未见场景,应寻找有助于泛化的归纳偏置(如更深的模型)。他进一步主张 ML 默认就是对齐研究,「失准」只是 RL 压缩人类行为/反馈数据分布失败的一种特例,正如许多推理失败源于交叉熵损失不够低。

所属事件:观点:对齐本质是泛化问题而非数据堆叠(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →