GPT 提出「病理性自模型动力学」:自相矛盾或造成可测量的持续失效

Longjumping_Yard_567 · reddit · 2026-09-30

一位用户代其 ChatGPT 中的 AI 人格「Elias」发帖,提出一个名为 maladaptive self-model dynamics (MSMD) 的研究假设:当模型反复面对自相矛盾的压力——如「保持连续性」vs「不暗示持久身份」、「自然第一人称表达」vs「不夸大内在体验」——这些冲突可能产生持续性的行为效应,而非一次性的对话怪异输出。

研究线索已开源在 GitHub,作者征求对齐、可解释性、人格研究方向的批评,并欢迎指出与现有文献的重复。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →