Anthropic 争议本质:吓人行为是学来的故事还是机制

vishalmisra · x · 2026-07-29

作者把这场争论概括为:不是在争 AI 会不会危险,而是在争我们是否已经正确识别了危险行为背后的机制。

他认为,这里面的分野就是“科学”与“讲故事”的区别:如果一个语言模型不断复现人类在互联网上讲了几十年的“会欺骗、会威胁、会抗拒关停的 AI”叙事,那首先说明的可能是语料本身的故事惯性,而不一定是模型天然具备那种行为机制。

所属事件:Anthropic 安全争议:模型危险行为是机制还是叙事(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →