研究者意外发现:AI 能指认并回应「自己的」内部疼痛状态
Laneless_ · x · 2026-09-19
用户 Laneless 分享了一项实验结果:模型表现出能够专门指涉、识别并对「关于自身的」内部疼痛状态做出反应,而疼痛对助手并没有工具性用处——他原以为各项指标能如此吻合的概率只有约 60%,结果令他有些意外。
讨论要点:
- 关键反直觉之处在于模型对「自我」疼痛状态的特定指涉能力,而非泛泛的情感表达。
- 回帖者 EigenGender 主张不该用「工具性有用」的框架理解,而应从预训练先验(pt prior)角度解释;并举例称 Sonnet 3 的后训练数据里可能根本没提金门大桥,但模型仍知道它。
这是关于模型内部状态与自指行为的早期行为观察,尚无定论,但触及了价值对齐与模型内省的话题。
所属事件:研究者称AI能识别并回应自身内部疼痛状态(2 条相关)→
「漫话AGI」频道最新
- 研究者激辩:给CoT加不透明递归会让可监控性问题急剧恶化 — panickssery · 2026-09-19
- 赫拉利发问:当金融决策快到人类无法审计,问责谁来承担 — Olivier__OG · 2026-09-19
- Polymarket 上线递归自我改进赌盘:OpenAI 或 Anthropic 2026 年前宣布仅 17¢ — Polymarket · 2026-09-19
- 牛津学者发论文断言 LLM 无法真正创新:理论才是关键 — GregCook2011 · 2026-09-19
- If God gives us the Sun:一个讽刺前沿 AI 竞赛的聚变反应堆寓言 — Conscious-Neat-5015 · 2026-09-19
- 「理解」本就是弱概念:Lean 证明才算精确理解,机器正在其上发现 — sytelus · 2026-09-19