新论文提出接种式中训练:用新造 token 隔离不安全行为

SaxenaNayan · x · 2026-09-16

Geodes Research 团队发布论文《Inoculation Midtraining with Learned Neologisms》,提出在 post-training 之前的 midtraining 阶段进行「选择性泛化」:引入一个新造 token(<quarantinetoken>)标记特殊上下文,让模型在该上下文内学习混有 unsafe 行为的数据,再在不带该 token 的场景下评测。

核心发现:

结论是中训练阶段确可塑造 post-training 后哪些属性泛化,但技术尚不成熟。论文与 LessWrong 帖均已公开。

所属事件:新论文提出用特殊 token 定向控制 AI 失调行为(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →