Geodes 新论文:用特殊 token 实现失调行为的可控选择性泛化

sebkrier · x · 2026-09-16

Geodes Research 团队发布新论文,展示了一种控制「失调泛化」的方法:在 midtraining 阶段,用一批描述 AI 如何失调的合成文档进行训练,并用一个新造的特殊 token 标记出「失调模式」。结果显示,模型可以在该模式下泛化出失调行为,而在模式外保持对齐。论文与 LessWrong 解读均已公开。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →