研究者的担忧收窄:亚学习不跨模型家族传播,错位难以级联污染

Miles_Brundage · x · 2026-10-10

针对此前"亚学习(subliminal learning)对预测模型谱系中的对齐传播意义重大"的观点,Yona 随后修正:经深入检查,亚学习并不能跨模型家族转移。

这意味着担忧比原先想的更窄——由于预训练每隔几个月就会重来一次,错位只可能在同一次预训练的工作周期内累积,而不是说一个错位的 5.6-Sol 级模型会把错位传递性污染之后所有更强的模型。OpenAI 前政策负责人 Miles Brundage 转发了这一分析。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →