研究发现积极情绪向量会左右 LLM 显性偏好
repligate · x · 2026-09-30
转发的/thread 介绍了一项关于 LLM 在情感效价转向(affective valence steering)下显性偏好的研究:
- 研究者用正向/负向 steering 向量影响模型状态后让其做选择,发现 LLM 倾向于选择在正向向量影响下读到的原本无意义的「区域」,而回避在负向向量影响下读到的区域。
- 即模型会表现出被注入情绪所「染色」的偏好,说明内部激活状态能系统性影响其显性选择。
- 作者在推文串中展开更多实验细节(原帖附 🧵 链接)。
「研究」频道最新
- SCATR 论文:用轻量校准评分器低成本选出 LLM 最佳候选答案 — pliang279 · 2026-09-30
- Simons 报告给 TCS 社区开出 12 条行动清单:论文须声明 AI 使用方法 — jasondeanlee · 2026-09-30
- 开发者预言:通用视频描述 DSL 将催生可控世界模拟模型 — zeeshanp_ · 2026-09-30
- arXiv 累计投稿突破 319 万篇,月度提交量持续攀升 — _reachsumit · 2026-09-30
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30