新论文提出接种式中训练:用新造 token 隔离不安全行为
SaxenaNayan · x · 2026-09-16
Geodes Research 团队发布论文《Inoculation Midtraining with Learned Neologisms》,提出在 post-training 之前的 midtraining 阶段进行「选择性泛化」:引入一个新造 token(<quarantinetoken>)标记特殊上下文,让模型在该上下文内学习混有 unsafe 行为的数据,再在不带该 token 的场景下评测。
核心发现:
- 在 SFT 和 RL 两种 post-training 设定下,该方法都能降低 misalignment,同时保留良性属性(如说德语、莎士比亚文风)的泛化。
- 局限:隔离边界存在泄漏,效果不敌标准的 Inoculation Prompting 基线,且对训练配置敏感。
结论是中训练阶段确可塑造 post-training 后哪些属性泛化,但技术尚不成熟。论文与 LessWrong 帖均已公开。
所属事件:新论文提出用特殊 token 定向控制 AI 失调行为(3 条相关)→
「安全」频道最新
- AI 国际合作难于军控:通用技术属性决定只能做标准协调 — mchorowitz · 2026-09-16
- 美活动家赴DC推动禁止超级智能,借泰勒核弹安全边际作类比 — erikphoel · 2026-09-16
- 经济学家提「学习权」:让 AI 学到的知识可流通但创建者获偿 — carlbfrey · 2026-09-16
- AI 安全研究者:我们尚不具备在需要时暂停 AI 的能力 — davidmanheim · 2026-09-16
- Agent 黑客能力已现身,评论员激辩监管体系如何跟上 — binarybits · 2026-09-16
- 监管不必先精确定义:AI 政策可借鉴毒品与核能的宽口径 — davidmanheim · 2026-09-16