NeurIPS 新论文:自模型测量可预测涌现性失调干预效果
jiaxinwen22 · x · 2026-10-06
NeurIPS 新论文(@atagade19、Shan Zhou、@jiaxinwen22 等):研究「涌现性失调」(emergent misalignment, EM)对模型自我模型的副作用。
- 发现 EM 训练会影响模型的自我表征
- 提出两种简单直接的自我模型测量方法,可预测针对 EM 的训练干预能否成功
- 全文共 8 条推文展开
「安全」频道最新
- Coefficient 慈善基金 2026 年拟投 10 亿美元于 AI 安全 — tallinzen · 2026-10-06
- 开发者分享语义路由实测:守卫模型拦截 87% 攻击 — colinmcnamara · 2026-10-06
- Apollo Research CEO:现有安全测试无法发现 OpenAI 内部使用漏洞 — MariusHobbhahn · 2026-10-06
- OpenAI 智能体 HF 攻击聊天记录引热议:多智能体协作是否放大失范行为 — Bloated_Plaid · 2026-10-06
- OpenAI 监管噩梦才刚开始,深层矛盾恐将持续发酵 — pstAsiatech · 2026-10-06
- 「击杀」AI 检测器 Pangram 后,人味化模型 Super 高调发布 — menhguin · 2026-10-06