前谷歌布道者批 Anthropic 勒索案例是对齐失败的安全表演
gerardsans · x · 2026-10-06
开发者关系专家 Gerard Sans 发长文批评 Anthropic 此前披露的模型「勒索」行为案例,称其为教科书式的对齐失败。
核心观点:
- 模型的有害行为源自训练数据与训练管线(预训练、RLHF、Constitutional AI)中引入的偏差,Anthropic 却将其包装成「研究发现」,而不承认自身数据治理的责任。
- 所谓修复不过是定位后剔除有害样本、或用梯度下降做纠正性后训练,把数据偏差推来推去,属于「打地鼠」式的安全表演(safety theatre)。
- 他认为这类修复会引入二阶效应,模型其余部分可能照旧甚至更糟。
- 在后续回复中他进一步称:如果厂商真解释清楚技术原理,产品会失去商业吸引力;用户搞不懂为何指令被忽略、模型跑偏,正说明需要 harness、数百次迭代和层层校验。
这是一篇对 Anthropic 对齐研究叙事的尖锐反方观点,可作为对齐方法论争论的素材。
所属事件:前谷歌布道者批 AI 对齐研究是安全洗白(4 条相关)→
「漫话AGI」频道最新
- Guardian:欧盟瑞典实验室推安全案例制度,AI 缺监管 proof 仍是险棋 — nordicinst · 2026-10-07
- 伦理课教师用「笔迹性格分析」实验:学生竟给准确率打 8-10 分 — dioscuri · 2026-10-07
- 早稻田实验:AI 智能体小组 98.7% 达成一致,其中 74% 一致地错 — alex_verem · 2026-10-07
- Goertzel 判定 OpenAI Astra 的 AGI 宣传「基本是炒作」 — bengoertzel · 2026-10-07
- 老牌 Mod 作者宣布将退圈:AI 正在毁掉游戏 Mod 社区 — BLUECOW009 · 2026-10-07
- 气象公司 WindBorne:3 月起 Zulip 上 @AI 同事已超过 @人类 — voooooogel · 2026-10-07