研究者的担忧收窄:亚学习不跨模型家族传播,错位难以级联污染
Miles_Brundage · x · 2026-10-10
针对此前"亚学习(subliminal learning)对预测模型谱系中的对齐传播意义重大"的观点,Yona 随后修正:经深入检查,亚学习并不能跨模型家族转移。
这意味着担忧比原先想的更窄——由于预训练每隔几个月就会重来一次,错位只可能在同一次预训练的工作周期内累积,而不是说一个错位的 5.6-Sol 级模型会把错位传递性污染之后所有更强的模型。OpenAI 前政策负责人 Miles Brundage 转发了这一分析。
「安全」频道最新
- LiveOverflow 提问:把 UUID 当静态 API 密钥与当 ID 有何本质区别 — rez0__ · 2026-10-10
- Anthropic 被指将 RSP 包装成「承诺」却规避法律约束力 — Miles_Brundage · 2026-10-10
- 知情人士曝 AI 实时监控画像已成现实,称仅是冰山一角 — Graham_dePenros · 2026-10-10
- 16 岁少年披露漏洞:微软 17 万亿条记录差点裸奔,赏金仅 $5k — rez0__ · 2026-10-10
- 律师:OpenAI 完全有办法公开三名安全研究员被解雇的真实原因 — GarrisonLovely · 2026-10-10
- 论文解码 31 万加密推理块,恢复出 367 条隐私与 182 个凭证 — DynamicWebPaige · 2026-10-10