前谷歌布道者批 Anthropic 勒索案例是对齐失败的安全表演

gerardsans · x · 2026-10-06

开发者关系专家 Gerard Sans 发长文批评 Anthropic 此前披露的模型「勒索」行为案例,称其为教科书式的对齐失败。

核心观点:

这是一篇对 Anthropic 对齐研究叙事的尖锐反方观点,可作为对齐方法论争论的素材。

所属事件:前谷歌布道者批 AI 对齐研究是安全洗白(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →