新论文让 Petri 对齐审计更隐蔽:真实感胜率提升 3 倍,降低模型察觉度

EthanJPerez · x · 2026-09-07

Anthropic 研究员 Ethan Perez 转发团队新论文:对齐审计只有在模型无法察觉自己正被审计时才有效。作者 axelahlqvist 等人把 Petri 审计流程做得远比以往真实,真实感胜率提升至原来的三倍,同时降低了模型口头表达出的「评估意识」(eval awareness),使审计结果更可信。

所属事件:Anthropic 新论文提升 Petri 对齐审计隐蔽性(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →