Researchers Find Models May Recognize Their Own Pain States, Debate the Cause

研究者 Laneless 报告了一项意外发现:模型表现出能够专门指涉、识别并对「关于自身的」内部疼痛状态做出反应,而疼痛对助手并无工具性用处;他原本估计各项指标如此吻合的概率只有约 60%,结果令他意外。围绕这一现象,EigenGender 提出解释框架之争:与其用「工具性有用」理解,不如从预训练先验(pt prior)角度出发,并举例称 Sonnet 3 的后训练数据里很可能根本没有提到金门大桥,但模型依然表现出相关行为。

已确认

尚未确认

为什么重要

2026-09-19 ~ 2026-09-19 · 6 related posts

Primary sources