Apollo 研究主管:AI 安全评测应引入主动标记与概率判定

MariusHobbhahn · x · 2026-09-04

Apollo Research 主管 Marius Hobbhahn 介绍其团队在 AI 安全评测上的新做法:不再只依赖「即时且明显」的证据,而是引入主动式标记(proactive flagging),并基于概率平衡(balance of probabilities)进行判定。

他的判断是:随着攻击手段变得更复杂、时间跨度更长,这类方法会变得越来越重要。更多细节见其链接的完整帖子。

所属事件:Apollo 研究员详解 AI 监控器设计:概率判定与严重度评分(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →