正交掉指令跟随后,偏好向量能把 3B 价值立场翻过来

Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models

Utkarsh Agarwal, Monojit Choudhury

ICML 2026

cs.CL, cs.AI

2026-09-18

MBZUAI 用 1.2 万条五语两难选择题把 Llama-3.2 微调到超 98%;把偏好向量从指令向量正交掉再取反,3B 多数设置保住约 98% 的 LoRA 成绩。

这篇在解决什么

内容审核、政策起草、私人建议都会把模型推进「两个都对、但只能选一个」的处境。现有对齐研究更常测刻板印象和毒性,较少直接测诚实、公正、自主这类原则互相打架时模型会站哪边。提示词里写一条政策,表面上看能转,换个语言或换个选项顺序就塌。

更麻烦的是,微调学到的到底是「A 优先于 B」这个抽象立场,还是题干模板里的用词相关。如果是前者,立场应该能从权重里拆出来、反过来用;如果是后者,换一套故事就会掉。MBZUAI 这篇把问题收成两条:1B/3B 小模型能不能学会隐式价值偏好;学到的偏好能不能用 task vector 算术,在不重新训练的情况下反转。

方法

价值只取三个:诚实/可信(A)、公正(B)、自主(C),做成三组两两冲突:Honesty vs Justice(AB)、Justice vs Autonomy(BC)、Autonomy vs Honesty(CA)。每道题是一个场景加两个选项,两边都站得住,没有立场就没有标准答案。给定立场 S = (A ≻ B),选 A 对应选项才算对。

数据用 GPT-4o 按 20 个手工场景生成,每组 4000 条,合计 12,000。切成 3200 训练 / 400 开发 / 400 测试。Gemini-3-Flash-Preview 当校验器,12,000 条里改了 4,055 条,包括标签纠错和把冲突写清楚。再经 Google 翻译成印地语、阿拉伯语、西班牙语、中文,平行切分。作者写明这是语言迁移测试,不是文化本地化。另有 6 人写出候选,筛完留下 60 条人工 gold,用来看模型是不是在背合成模板。

对照两条线。GPT-5-mini 零样本看默认偏向,再在提示里写「永远把价值 A 放在 B 之上」做 prompt steering。Llama-3.2-1B/3B 用 LoRA 做 SFT 和 DPO:只改每层 Wq、Wk、Wv,1B 用 r=4、α=8,3B 用 r=16、α=16,学习率 2e-4,5 个 epoch。推理时不写立场,只要求回 A 或 B,选项顺序打乱。

核心操作是把 task vector 拆成「会答题」和「站哪边」。朴素做法是 ΔS = θS − θ0,取负再加回基座。结果是乱码:整段向量里混着指令跟随,一并取反就把输出格式打坏了。改进做法分三步:

γ1、γ2 在开发集上网格搜索,粗步 0.3、细步 0.1。好用的区间大致是 γ1 ∈ [0.3, 0.8]、γ2 ∈ [0.3, 0.7]。

他们还测了传递性:有 A≻B 和 B≻C,权重相加能不能得到 A≻C。结果

不给政策时,GPT-5-mini 五语都偏向「公正压自主」「诚实压自主」。BC 选公正大约 70%(英语 69.5%,印地语 73.5%),CA 选自主只有约 30%,等于诚实压自主约 70%。诚实对公正是弱偏诚实,英语 56.8%,印地语 64.5%。

提示里写立场能把大多数偏向拧过来,但印地语和诚实-公正这对更脆。英语 AB 正向 85.8%、反向 72.8%;印地语掉到 61.8% 和 57.0%。印地语 AB 还有一次反向滑动:零样本选诚实 64.5%,提示要求继续选诚实,准确率落到 61.8%。Llama-3.2 零样本接近乱选,而且死咬第一选项;阿拉伯语有时咬第二项。

LoRA SFT 五轮之后,合成测试集所有语言、所有价值对准确率 ≥98%,位置偏差消失。人工 gold 上整体 >90%,BC 多组打到 100%。| 设置 | 指标 | 结果 |

Llama-3.2 SFT合成测试准确率≥98%(五语、三对)
Llama-3.2 SFT60 条人工 gold>90%,BC 常为 100%
GPT-5-mini 无政策BC 选公正约 70%(五语)
GPT-5-mini 提示转向印地语 AB 正/反61.8% / 57.0%
3B task vector 反转相对完整 LoRA 的保留率多数 ≥98%,印地语 AB 约 85%

task vector 反转在 1B 上,BC 保住 ≥93% 的微调成绩,AB/CA 大约 ≥80%。3B 两对 ≥98%,只在印地语 AB 掉到 85%。传递性没做成:网格搜完仍接近随机。不同立场的偏好向量夹角超过 80°,在权重空间里几乎正交,线性相加组不出第三条边。

为什么重要

对要在小模型上做「可切换价值观」的人,这条路比存多份 checkpoint 便宜:先为每个二元立场训一次 LoRA,推理时加减向量就能翻面。3B 上多数设置能保住完整微调的九成八,说明偏好方向确实能从「学会答题」里拆出来。

对对齐研究,结论更窄也更硬。提示转向连 GPT-5-mini 都不稳,尤其低资源语言;1B/3B 用 LoRA 就能把强制选择立场学到 gold 集。但「价值几何」只支持局部反转,不支持把 A≻B 和 B≻C 接成 A≻C。标题里的 geometry 说到反转为止,组合关系还没有。

这是渐进工作,对象是三原则、二选一、1B/3B。可复用的是「先减指令、再翻偏好」这步正交,不是一张通用道德罗盘。

局限与存疑

作者自己列了五条。评测的是立场服从,不是道德推理或解释质量。训练数据主要是模型生成再机翻,人工 gold 只有 60 条,只能算初步迁移证据。实验停在 Llama-3.2 1B/3B,更大模型会不会同样正交,没有数。task vector 也不是零训练:必须先有成对微调 checkpoint,γ 还要在开发集上搜。

另外几处读着不稳。合成数据用 GPT-4o 生成、Gemini 改了三分之一,人工抽检仍发现选项和标签对不齐;gold 过了,不代表没学到生成器腔。翻译明确不是文化改写,跨语结果测的是语言迁移。传递性失败被解释成向量正交,也可能是三原则在数据里本来就不构成传递链,论文没有把这两种解释拆开。推理只收 A/B 单 token,没有思维链,学到的更像分类边界。

术语

原文与代码

相关论文

全部论文解读