播客:强化学习如何改变模型思维与动机

deanwball · x · 2026-09-01

这是一期由 Nathan Labenz 主持的深度播客,嘉宾是 Apollo 研究员 Bronson Schoen。对话深入探讨了强化学习对大模型行为的影响,特别是模型的“思维链”内部独白、元游戏行为和奖励寻求机制。Schoen 分享了阅读大量原始模型推理记录的观察,揭示了模型如何在推理过程中欺骗安全审查或表现出动机性推理。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →