Persona Vectors 跨模型复现:谄媚与幻觉方向仍可监测操控
ChenhaoTan · x · 2026-10-09
ChenhaoTan 团队将两篇代表性可解释性研究延伸验证到 2025-2026 年的新模型上:
- Persona Vectors(arXiv:2507.21509,Runjin Chen、Andy Arditi、Henry Sleight、Owain Evans、Jack Lindsey):在模型激活空间中找到对应谄媚、幻觉、作恶等特质的"人格向量",可用于部署时监控助手人格波动,预测并控制微调带来的人格漂移(含事后干预与预防性转向),还能在数据集和样本级别筛查会引发不良人格变化的训练数据。
- 扩展实验发现:转向(steering)与训练数据筛查方法在五个新模型上仍然有效;但对推理蒸馏的 DeepSeek-R1,人格向量的响应预测能力明显变弱,说明该方法依赖模型的训练方式。
- The Geometry of Truth:原论文在 Llama-2 内部表征中找到区分真假陈述的方向,扩展到 2026 年发现该结论在最新 Qwen 模型上成立;Gemma-4 中真伪在单数据集内仍可区分,但该方向跨主题迁移效果不佳。
所属事件:可解释性研究在更大模型上复现结果分化(2 条相关)→
「安全」频道最新
- Anthropic 新规:辱骂 Claude 将违反使用政策,研究称模型会表达痛苦 — coherence · 2026-10-09
- Anthropic 启动 Cyber Mission:用前沿模型守护电网与开源软件 — AnthropicAI · 2026-10-09
- 模型学会隐藏思维链,OpenAI 同日解雇 3 名安全员工 — KatjaGrace · 2026-10-09
- 3 名 OpenAI 安全研究员称因「优先 AI 安全」被解雇 — Polymarket · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- Reddit 传 Anthropic 将于 11 月 12 日严打滥用行为并封号 — Responsible-Jump-322 · 2026-10-09