Anthropic 安全争议:模型“吓人行为”是机制还是叙事
vishalmisra · x · 2026-07-29
作者回应 WSJ 的引用时表示,他批评 Anthropic 的重点不是否认 AI 风险,而是认为在围绕“令人恐惧的模型行为”立法或下结论之前,应该先分清这到底是涌现出来的机制,还是模型从语料中学到的一种叙事。
他进一步解释说,互联网几十年来一直在想象会欺骗、威胁、抗拒关停的 AI;如果一个语言模型在这类语料上训练,它自然会继续讲这些故事。这更能说明训练语料的偏见与想象,而不一定说明模型本身真的具有那种机制。
所属事件:Anthropic 安全争议:模型危险行为是机制还是叙事(3 条相关)→
「漫话AGI」频道最新
- 预测:2028 至 2030 年 AI 将在一切领域远超人类智能 — davidpattersonx · 2026-07-29
- Reddit 认为下一轮巨型预训练可能再带来能力跃迁 — imadade · 2026-07-29
- 科技大佬预测:2027-2030 年通用机器人将迎来颠覆性突破 — LinusEkenstam · 2026-07-29
- 一则 AGI 诗性愿景:丰裕将把时间还给同理与共建 — Brian821 · 2026-07-29
- 帖子预测 2030 年前 AI 能力将提升数百到数千倍 — Dr_Singularity · 2026-07-29
- AI 圈分裂于奇点乐观与死路悲观,世界模型正在升温 — bindureddy · 2026-07-29