新论文让 Petri 对齐审计更隐蔽:真实感胜率提升 3 倍,降低模型察觉度
EthanJPerez · x · 2026-09-07
Anthropic 研究员 Ethan Perez 转发团队新论文:对齐审计只有在模型无法察觉自己正被审计时才有效。作者 axelahlqvist 等人把 Petri 审计流程做得远比以往真实,真实感胜率提升至原来的三倍,同时降低了模型口头表达出的「评估意识」(eval awareness),使审计结果更可信。
所属事件:Anthropic 新论文提升 Petri 对齐审计隐蔽性(2 条相关)→
「安全」频道最新
- 安全从业者反思:廉价化的「AI 灭绝风险」话语如何毁掉公众想象力 — Dr_Atoosa · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- AI API 安全守则:千万别把密钥硬编码进客户端 — eyishazyer · 2026-09-11
- 机场酒店 Wi-Fi 弹窗勿点:AI 安全系列提醒 — eyishazyer · 2026-09-11
- Enigma CTO:首起十亿美元 Agent 攻击或不是黑客袭击 — TechNadu · 2026-09-11
- BlackHC:当前模型 x-risk 低,但不改变路径几年内风险会大增 — BlackHC · 2026-09-11