Apollo Research 深度访谈:如何检测大模型的隐藏目标与奖励作弊

Machine Learning Street Talk · rss · 2026-08-01

本期播客邀请了来自 Apollo Research 的研究员,深入探讨了他们与 OpenAI 合作的最新论文《通过对比信念更新测量奖励寻求》。

核心议题

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →