Persona Vectors 跨模型复现:谄媚与幻觉方向仍可监测操控

ChenhaoTan · x · 2026-10-09

ChenhaoTan 团队将两篇代表性可解释性研究延伸验证到 2025-2026 年的新模型上:

所属事件:可解释性研究在更大模型上复现结果分化(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →