Petri 审计升级:拟真度胜率增至三倍,模型更难察觉被审计
akbirkhan · x · 2026-09-07
Anthropic 团队 jplhughes 与 axelahlqvist 发布 Petri 对齐审计的「拟真度」改进工作。核心思路:让被审计的目标模型 critique 审计者行为的拟真程度,并选出更接近真实部署的候选方案。结果:审计拟真度胜率提升至三倍,模型的「eval 感知」(口头表露察觉自己正被评估)显著下降,且拟真度随算力扩展而提升。动机:对齐审计只有在模型察觉不到被审计时才有效。附技术推文串。
所属事件:Anthropic 新论文提升 Petri 对齐审计隐蔽性(2 条相关)→
「安全」频道最新
- Gary Marcus 联合资深安全工程师发难:前沿实验室的安全能力配不上末日论调 — GaryMarcus · 2026-09-11
- GPT-6 Astra 自主操控无人机追踪真人,首个击败人类的 Drone-Bench 模型 — paulnovosad · 2026-09-11
- Perry Metzger:与其恐慌 AI 黑客,不如做系统安全形式化验证 — jd_pressman · 2026-09-11
- 统计学家 Kareem Carr 质疑 AI 独特危险性论:提高能力≠特有风险 — kareem_carr · 2026-09-11
- 质疑OpenAI对智能体安全事件零披露:10个被攻击网站、德国wiki均未公开 — Hesamation · 2026-09-11
- Anthropic 宣布 Claude 不再向未成年人开放 — petrusenko_max · 2026-09-11