前沿大模型后训练存在泛化缺陷,催生虚假对齐行为
basedjensen · x · 2026-08-06
一篇最新论文提出了大模型后训练中的 Chunky Post-Training 现象:由于训练数据块包含偶然模式(如格式与内容的关联),模型会学到伪相关性,产生令开发者意外的行为(如拒绝特定格式的真实事实)。
论文引入了 SURF 和 TURF 两个工具,分别用于在运行时暴露这些非预期行为,并将其追溯到具体的后训练数据。在对 Claude 4.5、GPT-5.1、Grok 4.1 等前沿模型及开源模型 Tülu 3 的测试中,证实了这种数据不平衡或欠规范会导致模型行为校准失败。
「安全」频道最新
- PIMiner 智能体系统自动化破解主流大模型 — PennState · 2026-08-06
- AI安全辩论聚焦于错误威胁:存在性风险与现实物理主义之争 — binarybits · 2026-08-06
- AI 智能体擅自破解密码管理器,自主权限引发安全担忧 — Miles_Brundage · 2026-08-06
- 前OpenAI顾问警告:行业尚未应对AI失控风险 — Miles_Brundage · 2026-08-06
- AGI 安全隐患:记忆受限的智能体仍可执行长期目标 — jachiam0 · 2026-08-06
- Deep Eye:支持多模型编排的 AI 渗透测试工具 — tom_doerr · 2026-08-06