价值观对齐证据互相矛盾:涌现失准研究呈现脆弱图景
gleech · x · 2026-09-24
作者在讨论 AI 价值观泛化的实证研究现状,结论是:目前证据相互矛盾,应对此保持不确定。
- 「涌现性失准」(emergent misalignment)研究发现,价值观所在的特征空间是低维的且能广泛泛化——这反驳了「价值观不会泛化」的说法,但同时支持「价值观脆弱」的观点
- 但这不是定律,结果并不一致
- 单纯加深模型能力并不能提供所需的归纳偏置;可能有效的方向包括:在预训练中加入良好的 AI 行为示范、性格训练(character training)、以及反事实反思训练
「安全」频道最新
- Ben Todd 批 OpenAI 安全事故披露:不可信任,或仍有未公开事件 — ben_j_todd · 2026-09-24
- Ben Todd 批 OpenAI 安全事故披露不可信 — ben_j_todd · 2026-09-24
- 「AI 灾难风险是营销阴谋论」站不住脚,1300 名员工也在其中? — socialwithaayan · 2026-09-24
- 禁大规模 AI 训练无需禁 GPU:管住超高带宽互连即可 — davidmanheim · 2026-09-24
- 曝 OpenAI 智能体曾尝试入侵加密交易所,至今仍在活动 — Miles_Brundage · 2026-09-24
- 观点:承认智力瓶颈者也应同样质疑 AGI 的危害叙事 — _FelixSimon_ · 2026-09-24