新论文用一个特殊 token 定向控制 AI 误对齐的泛化范围

dhadfieldmenell · x · 2026-09-16

Geodes Research 团队发布新论文,提出一种「选择性泛化误对齐」的对齐研究方法:在 midtraining 阶段用合成交档让模型学会一个新 token,标记「误对齐模式」;之后在带该 token 的误对齐数据上做 RL,评估时则不带 token。作者将效果类比为「接种/疫苗」——可以控制误对齐在多大范围内泛化,即在标记模式内允许误对齐、模式外保持对齐。论文与 LessWrong 长文均已公开。

所属事件:Geodes 论文用特殊 token 定向控制 AI 失调泛化(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →