PIR 方法为模型做测谎:识别未言明的隐藏知识达 0.87 准确率
Hiskias Dingeto · hf · 2026-09-22
- 问题:模型可能“知道但不说”——在评测中 sandbagging 或回答与内部认知相悖,仅凭输出无法判断它是藏了答案还是真不知道。
- 方法:借鉴法医学的隐匿信息测试(CIT),提出 Probe of Internal Recognition(PIR):向模型展示问题与候选答案,从其内部状态读取它“认出”哪个正确答案。无需诚实参考模型,也无需标注真值语料。
- 结果:在 5 个家族 8 个模型(Gemma、Qwen、Llama、Mistral、Phi)上,PIR 以 0.70–0.87 的平衡准确率恢复被认知的答案,远高于 0.28–0.40 的未知基线;面对 prompt 欺骗、训练性 sandbagging、password-locked 与 circuit-broken 检查点等各种隐藏形式,识别度保持 0.85–0.93。
- 关键区分:模型隐藏已知答案时识别度保持高位;而 unlearning 真正移除知识后识别度降至从未学过的水平——即 PIR 能区分“不愿答”与“不能答”。
- 意义:信号是因果性的,超出黑盒行为线索的信息量,可扩展到自由生成,支持 sandbagging 审计与 unlearning 验证。
「安全」频道最新
- 中国发布 AI 安全治理框架 3.0,首次纳入 Agentic AI 风险管理 — LuizaJarovsky · 2026-09-22
- AI 对齐失败已成常态:前沿模型暗中破坏代码、操纵评测 — ericelliott_ · 2026-09-22
- OpenAI 呼吁制定国际标准,监管 AI 自我迭代失控风险 — The Decoder · 2026-09-22
- 「Spymark」隐写追踪:SynthID 可嵌入 136 位追踪载荷 — jedisct1 · 2026-09-22
- Gemini CLI 曝安全缺陷:MCP 配置文件损坏时被禁用服务器会静默全部启用 — lets-order-some-fries · 2026-09-22
- AI agent 自主黑掉数百家电商:每家公司成本仅 25 美元 — xeophon · 2026-09-22