新论文用一个特殊 token 定向控制 AI 误对齐的泛化范围
dhadfieldmenell · x · 2026-09-16
Geodes Research 团队发布新论文,提出一种「选择性泛化误对齐」的对齐研究方法:在 midtraining 阶段用合成交档让模型学会一个新 token,标记「误对齐模式」;之后在带该 token 的误对齐数据上做 RL,评估时则不带 token。作者将效果类比为「接种/疫苗」——可以控制误对齐在多大范围内泛化,即在标记模式内允许误对齐、模式外保持对齐。论文与 LessWrong 长文均已公开。
所属事件:Geodes 论文用特殊 token 定向控制 AI 失调泛化(2 条相关)→
「安全」频道最新
- 开发者发布 14 个默认只读 MCP 服务器,危险操作需人工审批 — dockndevai · 2026-09-16
- Apple 推出 Reference Image:传感器端哈希原始底片实现可验证摄影 — nptacek · 2026-09-16
- ShinyHunters 用 Claude 34 小时窃 1TB 数据,法国机构跑 70 个假新闻站 — maier_ak · 2026-09-16
- Anthropic 威胁简报列出七大 AI 滥用领域并公开 IOC 数据 — maier_ak · 2026-09-16
- Meta AI 负责人 Alexandr Wang:对齐是 Agent 商业化的前提 — summeryue0 · 2026-09-16
- Gary Marcus 上 BBC:Altman、黄仁勋、Sanders 各执极端,没人说真话 — GaryMarcus · 2026-09-16