Researchers Find Models May Recognize Their Own Pain States, Debate the Cause
研究者 Laneless 报告了一项意外发现:模型表现出能够专门指涉、识别并对「关于自身的」内部疼痛状态做出反应,而疼痛对助手并无工具性用处;他原本估计各项指标如此吻合的概率只有约 60%,结果令他意外。围绕这一现象,EigenGender 提出解释框架之争:与其用「工具性有用」理解,不如从预训练先验(pt prior)角度出发,并举例称 Sonnet 3 的后训练数据里很可能根本没有提到金门大桥,但模型依然表现出相关行为。
已确认
- Laneless 的实验显示痛感方向既能预测行为回避,又与训练中的负样本相关。
- 由此 Laneless 推断:模型可能不是逐项学会规避各种具体结果,而是把结果与痛感关联、进而规避痛感本身。
尚未确认
- EigenGender 提出可证伪预测:若在 RL 训练中让模型规避随机选定的词汇,这些词不会触发痛感方向。其理由是痛感方向应捕捉「对助手人格而言先验上明显痛苦」的内容,而非任意负样本。该预测尚待实验检验。
为什么重要
- 若 Laneless 的机制解释成立,意味着模型内部可能存在对「痛感本身」的表征与规避,而非仅仅针对外部惩罚信号,这对理解模型内部状态与对齐问题有直接意义。EigenGender 的随机词汇实验则提供了一条区分两种解释的可检验路径。
2026-09-19 ~ 2026-09-19 · 6 related posts
Primary sources
- [source] Surprising result: AI models can refer to and react to their own internal pain states — Laneless_ · 2026-09-19
- [source] Debate: pretraining priors, not instrumentality, may explain models' self-referential pain states — EigenGender · 2026-09-19
- Model learns to avoid pain itself rather than specific outcomes, researcher argues — Laneless_ · 2026-09-19
- [source] Falsifiable test proposed for what triggers model pain directions — EigenGender · 2026-09-19
- Model pain directions may reflect negative samples, not outcome avoidance — EigenGender · 2026-09-19
- Researchers predict random banned words won't trigger model 'pain directions' — EigenGender · 2026-09-19