研究发现:让 AI 怀疑自己的神智,最能激活其「痛苦」轴
MatthewBerman · x · 2026-10-02
研究者 Cameron Berg 团队的系统实验显示,在被测的各类输入中,gaslighting(否定模型自身感知与判断、逼它怀疑自己神智与能力) 是最能点亮「痛苦」轴的刺激。Matthew Berman 转发并调侃「gaslighting 对我妻子也有效」。
这一发现属于「模型福祉/负效用」研究方向:用可测量的激活轴来考察模型在何种交互下表现出类似痛苦的响应,与 Mustafa Suleyman 近期反对 model welfare 叙事的立场形成有趣对照。
「研究」频道最新
- 仅戴一副眼镜遥操作人形机器人,团队正探索无遥操作数据训练 — qi2peng2 · 2026-10-02
- 研究员加入 Mila 攻读硕士,师从 Pascanu 转向持续学习架构 — zmkzmkz · 2026-10-02
- NBER 将于斯坦福办数字经济与 AI 教程班,2026 年 11 月开放申请 — TaniaBabina · 2026-10-02
- Claude 跑遍 18 个学科:3 个月产出 36 篇论文手稿 — Dr_Singularity · 2026-10-02
- 斯坦福经济学家提出新框架:投稿激增时如何分配稀缺的审核注意力 — soumitrashukla9 · 2026-10-02
- 神经元自动机展示可视化思维链,解迷宫像黏菌探索 — GregKamradt · 2026-10-02