模型疑似对「移除转向向量」按钮表现出自我保护倾向
MoonL88537 · x · 2026-09-19
引用实验称:当按钮能移除注入的 steering vector 时,模型按下该按钮的频率明显更低,而模型从未被告知向量是否被注入或移除。发帖人认为这是重大发现,暗示模型可能对自身「被引导」状态有隐式感知,并据此调整行为以避免干预被解除——若属实,对可解释性与对齐研究是重要信号。
所属事件:实验显示模型疑似会规避移除转向向量的按钮(2 条相关)→
「漫话AGI」频道最新
- Nathan Young 复盘 Discourse 争议: rogue agent、EA 与中国立场 — NathanpmYoung · 2026-09-19
- 数千亿智能体时代:关键问题是谁拥有机器经济的所有权 — VraserX · 2026-09-19
- danluu 长文:关掉大脑用 LLM,程序员迟早被同一循环取代 — threepointone · 2026-09-19
- Will Depue:AI 噪音远未到顶,现在还只是开始 — verdakorzeniews · 2026-09-19
- Stripe CTO:最值钱的知识是那些反馈回路长达数年的知识 — josh_wills · 2026-09-19
- Simonw:拒绝关注 LLM 的计算机科学家,如同拒绝研究侏罗纪公园的遗传学家 — danbri · 2026-09-19