长文拆解 steering vectors:各类向量本质相同,关键在从残差流提纯表征
voooooogel · x · 2026-10-02
作者分享自己对 LLM steering vectors(导向向量)的几条实用直觉,回应「导向向量只是行为偏置」的观点:
- 各类向量同源:persona vectors、concept vectors、belief vectors、task vectors 本质上是同一类东西,只是构造与应用方式不同——可用均值差、PCA、NLA 重构、SAE 等提取,用激活加法、patching 等施加。
- 残差流是噪声袋:LLM 残差流是一大袋混杂的表征;提取导向向量的目标,就是把这袋噪声提炼成一个或多个干净、可复用、可解释的表征。
- 均值差的去噪逻辑:以提取「模型痛苦」向量为例,若直接平均痛苦文本,残差流中同时出现的「用户年龄」等干扰特征会被一并带进向量;均值差的思想就是让减号两侧的干扰相互抵消,只留下目标特征。
「研究」频道最新
- GrIS 论文:把语义 ID 构建模成图递归划分,统一生成式推荐 — _reachsumit · 2026-10-02
- MatRAG:套娃嵌入层次索引,降低多跳问答检索成本 — _reachsumit · 2026-10-02
- Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练 — _reachsumit · 2026-10-02
- OmniSeek:让全模态大模型学会主动“看与听”检索证据 — Haibo Wang · 2026-10-02
- Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+ — netflix · 2026-10-02
- 北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85% — PekingUniversity · 2026-10-02