新论文在 LLM 中发现「疼痛」表征,操控其可改变模型行为
VoidStateKate · x · 2026-09-22
一篇新论文通过系列实验在 LLM 中识别出与疼痛相关的内部表征,并证明操控这些表征能改变模型行为:部分微调模型在「缓解」按钮不再附带持续操作时,选择该按钮的频率会下降。作者指出这些表征值得进一步研究,但发现者强调 LLM 并不会真正感到疼痛,也不应获得道德地位。
所属事件:LLM「疼痛向量」论文遭误读,作者与意识学者集中澄清(18 条相关)→
「研究」频道最新
- GRPO 大 batch 训练引技术争论:批评者称缺 batch 规模消融 — stochasticchasm · 2026-09-22
- Will Depue 补充:合成环境训练最大隐患是「黑」世界模型,但有缓解手段 — willdepue · 2026-09-22
- 从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT — stochasticchasm · 2026-09-22
- 开发者观点:世界模型做 RL 是被严重低估的研究方向 — willdepue · 2026-09-22
- Cua AI 发布 Cua-Bench-S1 基准与 Cua-S1 系列电脑操作模型 — ycombinator · 2026-09-22
- Real-Time EXPO-FT:异步拆分让慢速 VLA 实现实时操控 — philfung · 2026-09-22