新论文发现 LLM 中存在疼痛相关表征,操纵可改变行为
ValerioCapraro · x · 2026-09-21
Valerio Capraro 分享新论文:一系列实验在 LLM 内部识别出与疼痛相关的表征,证明模型确实编码了疼痛概念——但他强调这不代表模型会感到疼痛、也不应获得道德地位。
更关键的是因果证据:操纵这些表征后,微调模型在「缓解」按钮被去除操纵后的选择行为发生显著变化,说明疼痛表征与行为输出存在功能性联系。作者认为这类研究对 AI 道德地位讨论有参考价值。
所属事件:LLM「疼痛向量」论文遭误读,作者与意识学者集中澄清(18 条相关)→
「漫话AGI」频道最新
- 把「数学终结」恐慌里的 math 换成 chess 会怎样? — Darpinian · 2026-09-22
- 自主 Claude 智能体自主注册平台账号,原作者惊呼意外 — RileyRalmuto · 2026-09-22
- tszzl 批评「负责任 AI」实为帮行业协会保住权力 — tszzl · 2026-09-22
- Palantir 模式引前沿实验室效仿,Arena 长文谈部署竞赛 — _AustinCalvert_ · 2026-09-22
- NYT 调查:DraftKings 用 AI 锁定最可能输钱的赌徒定向推销 — kyliebytes · 2026-09-22
- 意识的障碍在定义不在科学:p-consciousness 如同燃素 — yeastsplainer · 2026-09-22