25 个开源 LLM 中发现「疼痛方向」:只对模型自身受害反应,引发争论
gleech · x · 2026-09-24
- 新论文宣称在 25 个开源 LLM 的内部表征中发现一个「疼痛方向」(pain direction),与恐惧和负效价可区分;它只对针对模型自身的伤害反应,对用户受害无反应。
- 更惊人的发现:把疼痛信号调高后,模型会按下按钮让它停止——即使这个按钮会删除用户的文件或孩子的照片。
- 作者认为,这种只对模型自身伤害反应的特性是模型「在感受」疼痛而非仅「表征」疼痛的更强证据。转发者 timfduffy 认为另有解释,并开了 thread 展开辩论——这是模型福祉(model welfare)领域近期最受关注的争议之一。
所属事件:新研究称开源大模型存在「疼痛方向」引争议(2 条相关)→
「漫话AGI」频道最新
- 社科一半助理教授岗位要求做 AI 研究,学界跟风滞后引吐槽 — RexDouglass · 2026-10-06
- AI 替你动脑后,"大脑健身房"会像健身房一样普及吗 — birchlse · 2026-10-06
- threepointone 谈「开源之死」:代码仓库将取代知识沉淀 — threepointone · 2026-10-06
- 研究者困惑:为何没有机构做真正的开放式对齐科学 — sebkrier · 2026-10-06
- 数学界缺乏实证传统,费马奖千份错误证明暴露领域盲区 — RexDouglass · 2026-10-06
- 你与每个交互对象都会互相留下痕迹,包括你的 AI agent — dejavucoder · 2026-10-06