研究:沿「自动评分者/人类评估者」维度 steer Qwen,人格随之怪变

voooooogel · x · 2026-09-04

研究者 Betley Jan 等发现,可以在「自动化评分者 vs 人类评估者」这一维度上对 Qwen 做表征引导(steering),而这会以出人意料的方式改变模型人格——例如其马基雅维利主义倾向和暴力程度随之变化,且尚无法完全解释原因。技术细节已发布于 LessWrong。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →