Apollo 研究员详解 AI 监控器设计:概率判定与严重度评分

Apollo Research 主管 Marius Hobbhahn 介绍其团队在 AI 安全评测上的新思路:监控器不应只依赖即时且明显的证据,而应基于概率平衡主动标记可疑行为;同时应把严重度评分作为中间结果输出,而非直接给出二元判断。他称这是愿意「死守」的设计观点。

2026-09-04 ~ 2026-09-04 · 3 条相关

事件全程(共 2 集)→