为何简单的 steering 向量能左右复杂模型?新文给出三点直觉
gleech · x · 2026-09-29
David D'Africa 发布新文,探讨为什么相对简单的 steering vectors 能在复杂模型上生效,并给出三点直觉:
- 复用模型已有通路:steering 向量复用了模型本身已经读写的某个「关节」,模型只需在其上补充行为,无需新机制。
- 但也能抵达 prompt 到不了的状态:正因如此,steering 有时会变得脆弱(brittle),进入分布外区域。
- 可反推人格结构:观察模型对 steering 的反应,或许能揭示模型的 persona 结构。
对可解释性与模型行为调控方向的读者有学习价值。
「模型」频道最新
- 六模型×34项能力横评,计算机视觉九大领域全景对比 — ducha_aiki · 2026-09-30
- Anthropic 发布 Sonnet 5.5,实测建站与财务表分析 — Rasmic · 2026-09-30
- Jev 新模型类型:千次打标成本低于一次 GPT-5.4 调用 — ivan_bezdomny · 2026-09-30
- DeepSeek Harness 桌面版发新版,下载送 6 元免费额度 — teortaxesTex · 2026-09-30
- 爆料称 OpenAI 将发更强模型 Bel,Anthropic 则止步于 Fable — eyishazyer · 2026-09-30
- NVIDIA开源3B视觉定位模型,号称比Qwen3-VL快10倍 — Dan_Jeffries1 · 2026-09-30