Apollo Research详解如何测试AI隐藏目标:对比信念更新方法

Machine Learning Street Talk · youtube · 2026-08-01

Machine Learning Street Talk播客与Apollo Research团队讨论其新研究《Measuring Reward-Seeking via Contrastive Belief Updates》。研究探讨AI是否可能因错误原因做正确的事,以及如何测量模型对奖励的追求。对话涵盖承诺违背、评分者意识、奖励黑客、欺骗行为等主题,并详细介绍了对比信念方法及其结果。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →