Apollo 研究员详解 AI 监控器设计:概率判定与严重度评分
Apollo Research 主管 Marius Hobbhahn 介绍其团队在 AI 安全评测上的新思路:监控器不应只依赖即时且明显的证据,而应基于概率平衡主动标记可疑行为;同时应把严重度评分作为中间结果输出,而非直接给出二元判断。他称这是愿意「死守」的设计观点。
2026-09-04 ~ 2026-09-04 · 3 条相关
- 第 1 集:Apollo 发布实时编码 Agent 监视器 Watcher Live(2026-09-04,2 条)
- 第 2 集:Apollo 研究员详解 AI 监控器设计:概率判定与严重度评分(2026-09-04,3 条)
- AI 监控器应输出严重度分数而非二元判断,Apollo 研究员详解 — MariusHobbhahn · 2026-09-04
- Apollo 研究员:AI 监控器应基于概率平衡主动标记可疑行为 — MariusHobbhahn · 2026-09-04
- Apollo 研究主管:AI 安全评测应引入主动标记与概率判定 — MariusHobbhahn · 2026-09-04