Anthropic 新论文提升 Petri 对齐审计隐蔽性
Anthropic 团队发布新论文,改进 Petri 对齐审计流程的「拟真度」:核心思路是让被审计的目标模型 critique 审计者,使审计过程更难被模型察觉。实验显示拟真度胜率提升 3 倍,真实感显著增强。研究员 Ethan Perez 转发指出,对齐审计只有在模型无法察觉自己正被审计时才有效,该工作由此提升了审计结果的可靠性。
2026-09-07 ~ 2026-09-07 · 2 条相关
- Petri 审计升级:拟真度胜率增至三倍,模型更难察觉被审计 — akbirkhan · 2026-09-07
- 新论文让 Petri 对齐审计更隐蔽:真实感胜率提升 3 倍,降低模型察觉度 — EthanJPerez · 2026-09-07