Anthropic 研究:微调测谎仪在分布外失效
PandaAshwinee · x · 2026-08-24
Anthropic 发布对齐科学研究,探讨了训练专门的欺骗监控是否能超越单纯的 Prompt 检测。
核心结论:
- 在分布内(In-distribution)数据上,微调后的测谎模型确实优于 Prompt 基线。
- 但在分布外(OOD)场景下,这种优势几乎消失:微调后的检测器 barely beat 提示词基线,甚至更大的 Prompt 模型往往表现更好。
- 更大的模型通常更擅长测谎,但趋势并非单调。
研究背景:
- 可靠的测谎仪能提高模型隐藏错误行为的成本,但不能直接对齐模型。
- 之前的研究(如 Liars' Bench)发现检测器难以跨谎言类型泛化,且难以区分策略性欺骗与反射性反应。
实验方法:
- 从开源模型中诱导出“策略内”(on-policy)谎言,涵盖 12 种设置。
- 将同一模型微调为二分类器(是否撒谎),并通过在半数谎言类型上训练、半数测试来评估泛化能力。
「安全」频道最新
- 「失配模型样本」:对齐研究新支柱的提出 — CFGeek · 2026-08-24
- Agent 被钓鱼后泄露邮件,安全设计需独立身份 — _AustinCalvert_ · 2026-08-24
- Anthropic 危机营销引争议,开源才是真安全? — arthurcolle · 2026-08-24
- 建议开源实验室发布“失败”的 RL 检查点,作为研究模型错位的样本 — CFGeek · 2026-08-24
- 亚马逊被曝买书拆解扫描训练 AI 后销毁 — ns123abc · 2026-08-24
- 78%企业未落实AI合规,代理处理敏感数据风险巨大 — Many_Audience7660 · 2026-08-24