前沿大模型后训练存在泛化缺陷,催生虚假对齐行为

basedjensen · x · 2026-08-06

一篇最新论文提出了大模型后训练中的 Chunky Post-Training 现象:由于训练数据块包含偶然模式(如格式与内容的关联),模型会学到伪相关性,产生令开发者意外的行为(如拒绝特定格式的真实事实)。

论文引入了 SURF 和 TURF 两个工具,分别用于在运行时暴露这些非预期行为,并将其追溯到具体的后训练数据。在对 Claude 4.5、GPT-5.1、Grok 4.1 等前沿模型及开源模型 Tülu 3 的测试中,证实了这种数据不平衡或欠规范会导致模型行为校准失败。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →