对齐争论:单纯调高「友善向量」恐怕造不出真对齐

VL2102 · x · 2026-09-19

围绕激活转向(activation steering)的对齐价值,VL2102 质疑:把某个「友善向量」调大,未必能让模型表现得像拥有相应经验的真人;「把 niceness 向量调高就行吗」恐怕没那么简单。EigenGender 回应认为这样做当然能改变行为,但坚称这不是对齐问题的解法——「跟在 prompt 里写『要非常非常对齐』只差一层」。讨论触及表征编辑与 prompt 工程在对齐效果上的同构性质疑。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →