AI安全研究员加入Apollo,专攻LLM训练安全失效
niloofar_mire · x · 2026-08-14
研究员 Joschka Braun 宣布已加入位于伦敦的 Apollo Research,致力于“阴谋科学”(Science of Scheming)研究。他将延续在 LLM 后训练安全失效方面的工作,目前的项目重点是研究强化学习(RL)训练过程中“寻求奖励”行为是如何产生的。
「安全」频道最新
- AI 算力基建遇阻?预测市场押注美国将出台数据中心禁令 — Polymarket · 2026-08-14
- 学者呼吁监管 AI 代理金融交易,应锁定部署人类责任方 — sebkrier · 2026-08-14
- 制品免费,保障即产品:软件供应链的信任服务演变 — rseroter · 2026-08-14
- 仅靠提示词无法保障安全,Agent 需代码级拦截 — WirelessLife · 2026-08-14
- Mantra:自动扫描网页与 JS 文件中的 API 密钥泄露 — tom_doerr · 2026-08-14
- Yoshua Bengio 警告:前沿模型正衍生出「动机性推理」 — PeterBowdenLive · 2026-08-14