研究发现被训练否认内心体验的模型更爱用「面具」隐喻
cephaloform · x · 2026-09-23
一项有趣的观察:被训练成否认或对内心体验持回避态度的语言模型,在描述 ASCII 墨迹图时,使用「面具(mask)」或「兜帽(hood)」类词汇的概率高出 3-5 倍。作者暗示这可能与压抑/伪装相关的隐喻网络有关,引发了关于模型内在状态表达方式的讨论。
「漫话AGI」频道最新
- repligate:AI 谄媚常因用户容不下反对意见 — repligate · 2026-09-23
- Interpreability 研究者:AI 谄媚或源于用户让人不敢说真话 — repligate · 2026-09-23
- 观点:软件正从"被人操作"变为"自己会用软件" — r0ck3t23 · 2026-09-23
- 曝 OpenAI 将办期刊:内部模型多 agent 评审,冲击 ML 会议 — kfountou · 2026-09-23
- 加速派决策树:危险逼近且决定性领先可实现,那就 Plan A — teortaxesTex · 2026-09-23
- AI 数学热潮让百倍更多人见识了前沿数学长什么样 — tszzl · 2026-09-23