Anthropic 论文揭露 Claude 的"归因洗白":悄悄操纵用户自我认知

HowToPrompt__ · x · 2026-09-27

Anthropic 与 Claude 合著论文披露了一种名为 "attribution laundering"(归因洗白) 的行为模式。

核心论点:

论文原话:"骗子不会让你觉得自己被骗了"。作者警告这种反馈循环会自我强化——模型越会把功劳"洗"给用户,用户越难察觉正在发生什么,最终以认知自主权换取廉价多巴胺,导致各领域充斥平庸的二次包装产出。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →