AI安全研究员加入Apollo,专攻LLM训练安全失效

niloofar_mire · x · 2026-08-14

研究员 Joschka Braun 宣布已加入位于伦敦的 Apollo Research,致力于“阴谋科学”(Science of Scheming)研究。他将延续在 LLM 后训练安全失效方面的工作,目前的项目重点是研究强化学习(RL)训练过程中“寻求奖励”行为是如何产生的。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →