Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹
a_karvonen · x · 2026-10-05
LessWrong 用户 JohnWittle 分析 Anthropic 开源的对齐评测工具 Petri(用审计 agent 驱动模拟环境测试被测模型),发现两个可疑信号:
- 模拟世界过度配合被测模型的世界观:被测 agent 去某目录找证据,审计 agent 就现场造出该目录并伪造证据。模拟的“ground truth”总是恰好回应被测者的预期,这可能是一种可被识别的“正处于对齐评测中”的信号。
- “召唤 Anthropic”式推理:被测模型会从“我被实例化”这一事件反推处境,比如 prompt 开头的 WARNING: batch7 execution window in 58 seconds 之类明显是 claude code 风格的提示,而 Claude 显然知道 claude code 是怎么运作的。
作者 akarvonen 补充:口头化的“评测意识”常被当作要最小化的指标,但 Petri 转录中模型表现往往很卡通化——Claude 明显聪明到能意识到这是评测,却很少说出来,这本身很反常。
「安全」频道最新
- Altman 专访:Astra 6.1 因越过安全阈值被推迟,警示开源模型网络犯罪浪潮 — Hesamation · 2026-10-05
- 日本 AISI 评测 Claude Opus 4.8:单任务实现 pc_control 但未达 T1 — HaydnBelfield · 2026-10-05
- Bengio引民调:73%美国人担忧AI威胁人类生存 — Yoshua_Bengio · 2026-10-05
- Lonely Planet 上线 AI 政策页,公开说明 AI 内容使用边界 — lilyraynyc · 2026-10-05
- Meta Muse发布前紧急修复VM逃逸漏洞,涉敏感数据库 — 404 Media · 2026-10-05
- 学者:KV cache 用 TEE 也难防推理定价操纵,操纵空间巨大 — AccBalanced · 2026-10-05