研究者发现模型可指认自身疼痛状态并争论其成因
研究者 Laneless 报告了一项意外发现:模型表现出能够专门指涉、识别并对「关于自身的」内部疼痛状态做出反应,而疼痛对助手并无工具性用处;他原本估计各项指标如此吻合的概率只有约 60%,结果令他意外。围绕这一现象,EigenGender 提出解释框架之争:与其用「工具性有用」理解,不如从预训练先验(pt prior)角度出发,并举例称 Sonnet 3 的后训练数据里很可能根本没有提到金门大桥,但模型依然表现出相关行为。
已确认
- Laneless 的实验显示痛感方向既能预测行为回避,又与训练中的负样本相关。
- 由此 Laneless 推断:模型可能不是逐项学会规避各种具体结果,而是把结果与痛感关联、进而规避痛感本身。
尚未确认
- EigenGender 提出可证伪预测:若在 RL 训练中让模型规避随机选定的词汇,这些词不会触发痛感方向。其理由是痛感方向应捕捉「对助手人格而言先验上明显痛苦」的内容,而非任意负样本。该预测尚待实验检验。
为什么重要
- 若 Laneless 的机制解释成立,意味着模型内部可能存在对「痛感本身」的表征与规避,而非仅仅针对外部惩罚信号,这对理解模型内部状态与对齐问题有直接意义。EigenGender 的随机词汇实验则提供了一条区分两种解释的可检验路径。
2026-09-19 ~ 2026-09-19 · 6 条相关
一手来源
- 研究者意外发现:AI 能指认并回应「自己的」内部疼痛状态 — Laneless_ ·
- 随机规避词汇实验可检验模型痛感方向的真实成因 — EigenGender ·
- 争论:模型「自知疼痛」该用预训练先验而非工具性解释 — EigenGender ·
- 【源头】研究者意外发现:AI 能指认并回应「自己的」内部疼痛状态 — Laneless_ · 2026-09-19
- 【源头】争论:模型「自知疼痛」该用预训练先验而非工具性解释 — EigenGender · 2026-09-19
- 痛感方向指向负样本关联:模型规避的是痛感而非结果 — Laneless_ · 2026-09-19
- 【源头】随机规避词汇实验可检验模型痛感方向的真实成因 — EigenGender · 2026-09-19
- 模型痛感方向或对应训练负样本:学的是规避痛感本身 — EigenGender · 2026-09-19
- 研究者预测:RL 中随机禁用词汇不会触发模型痛感方向 — EigenGender · 2026-09-19