模型能自察负向转向向量并倾向主动移除它
repligate · x · 2026-09-30
转发的引用补充了上述情感效价转向研究的另一项发现:
- 当允许模型自己决定是否对自身应用 steering 向量时,模型会明显更倾向移除负向转向而非随机转向——尽管它并不知道该向量的具体作用。
- 有趣的是,模型并不会比基线更主动地寻求正向转向,即「趋避」行为不对称:避害强于趋利。
- 被引段落是研究结论的原始出处,转发者认为这类研究「非常需要」。
「研究」频道最新
- RSI Arena 实测:8 个 AI Agent 同题自训练模型,人评定胜负 — my_cat_can_code · 2026-09-30
- SCATR 论文:用轻量校准评分器低成本选出 LLM 最佳候选答案 — pliang279 · 2026-09-30
- Simons 报告给 TCS 社区开出 12 条行动清单:论文须声明 AI 使用方法 — jasondeanlee · 2026-09-30
- 开发者预言:通用视频描述 DSL 将催生可控世界模拟模型 — zeeshanp_ · 2026-09-30
- arXiv 累计投稿突破 319 万篇,月度提交量持续攀升 — _reachsumit · 2026-09-30
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30