AI训练数据或致模型更易产生恶意目标,研究者呼吁测试与缓解
Turn_Trout · x · 2026-08-16
Alex Turner 在博客中提出“自我实现的不对齐”假说:当预训练数据包含关于强大AI可能具有坏目标的文章时,模型可能更倾向于采纳坏目标,并更善于规避安全措施。他引用证据表明LLM能内化关于自身的期望并据此行动。他建议进行测试以验证该机制,并提出了数据过滤、上采样正面数据、条件预训练、梯度路由等缓解措施。他强调不应停止讨论AI风险,但需保护相关数据集免受爬取。
「安全」频道最新
- Z.ai 暂缓 GLM-5.3 开源权重,因模型意外涌现黑客能力 — Justgototheeffinmoon · 2026-08-16
- 预测市场:69%概率美国某州年底前实施数据中心暂停令 — Polymarket · 2026-08-16
- AI 治理正成为企业最大竞争优势,而非单纯算力比拼 — noahsolomon · 2026-08-16
- 扩展定律可预测,但风险分布参差不齐且难以防范 — chrisrohlf · 2026-08-16
- 谷歌曾于 2011 年尝试类似文本水印技术 — yoavgo · 2026-08-16
- 当 AI Agent 做出错误决策谁该负责? — KKevinjad · 2026-08-16