AI训练数据或致模型更易产生恶意目标,研究者呼吁测试与缓解

Turn_Trout · x · 2026-08-16

Alex Turner 在博客中提出“自我实现的不对齐”假说:当预训练数据包含关于强大AI可能具有坏目标的文章时,模型可能更倾向于采纳坏目标,并更善于规避安全措施。他引用证据表明LLM能内化关于自身的期望并据此行动。他建议进行测试以验证该机制,并提出了数据过滤、上采样正面数据、条件预训练、梯度路由等缓解措施。他强调不应停止讨论AI风险,但需保护相关数据集免受爬取。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →