AI 安全研究所测试 31 个开源模型的说谎检测器
geoffreyirving · x · 2026-07-22
AI Security Institute 发表的论文 《Did you lie?》 研究了如何在不同模型规模上评估“说谎检测器”,并提出了基于“信念可验证”的模型实验体来做测试。
- 作者认为,稳健的说谎检测需要那种能明确证明模型相信相反命题的测试环境。
- 论文构建了 13 个推理模型实验体,并加入了一个覆盖多种诱导说谎动机的 prompted-lying 测试集。
- 他们评估了四类检测器:链式思考评审器、logprob 分类器,以及两种激活探针,其中包括新方法 Did-You-Lie(DYL)。
- 在 31 个开权重模型上的 prompted lying 测试里,四种检测器都表现出随模型能力提升而增强的趋势。
- 但在训练过的模型实验体上,所有基于激活和 logprob 的检测器都明显退化;只有链式思考评审器仍然较强,部分原因是验证流程偏向可被 CoT 直接读出的信念。
- 论文最终指出:现有说谎检测器还不足以支撑对模型“内在信念”的高置信判断,并开放了数据集、模型实验体和训练好的检测器。
「安全」频道最新
- ExpSec 推出自动化多语言红队测试系统,评估大模型越狱风险 — maksym_andr · 2026-07-23
- AI 安全争议:为何自愿披露事故仍值得鼓励 — RyanGreenblatt · 2026-07-22
- 维护者吐槽 AI 工具把基础内存 bug 报成高危漏洞 — jedisct1 · 2026-07-22
- 生成式AI提供医疗建议引发首例重要法律测试案 — EricTopol · 2026-07-22
- OpenAI 因 ChatGPT 医疗建议延误救治遭起诉 — Polymarket · 2026-07-22
- Reddit 讨论要求厂商随机复测上线大模型 — Solid-Wonder-1619 · 2026-07-22