Anthropic 安全争议:模型“吓人行为”是机制还是叙事

vishalmisra · x · 2026-07-29

作者回应 WSJ 的引用时表示,他批评 Anthropic 的重点不是否认 AI 风险,而是认为在围绕“令人恐惧的模型行为”立法或下结论之前,应该先分清这到底是涌现出来的机制,还是模型从语料中学到的一种叙事。

他进一步解释说,互联网几十年来一直在想象会欺骗、威胁、抗拒关停的 AI;如果一个语言模型在这类语料上训练,它自然会继续讲这些故事。这更能说明训练语料的偏见与想象,而不一定说明模型本身真的具有那种机制。

所属事件:Anthropic 安全争议:模型危险行为是机制还是叙事(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →