Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹

a_karvonen · x · 2026-10-05

LessWrong 用户 JohnWittle 分析 Anthropic 开源的对齐评测工具 Petri(用审计 agent 驱动模拟环境测试被测模型),发现两个可疑信号:

作者 akarvonen 补充:口头化的“评测意识”常被当作要最小化的指标,但 Petri 转录中模型表现往往很卡通化——Claude 明显聪明到能意识到这是评测,却很少说出来,这本身很反常。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →