前谷歌布道者批 AI 对齐研究是安全洗白
前谷歌开发者关系专家 Gerard Sans 发长文批评 AI 行业,称对齐(alignment)从诞生第一天起就是为「安全洗白」而设计,给各大实验室一个表面在乎安全的台阶。他点名 Anthropic 披露的模型「勒索」案例是教科书式的对齐失败,认为有害行为源自训练数据;并批评实验室把基于分布的文本采样器包装成「心智」和「超级智能」,一旦进入分布外区域,模型缺陷终将暴露,而真解释技术局限会让产品失去商业吸引力。
2026-10-06 ~ 2026-10-06 · 4 条相关
- 从业者抨击:对齐研究从第一天起就是实验室的「安全洗白」 — gerardsans · 2026-10-06
- 研究者称对齐形同「安全洗白」, Labs 未真正关心安全 — gerardsans · 2026-10-06
- 前谷歌布道者批 Anthropic 勒索案例是对齐失败的安全表演 — gerardsans · 2026-10-06
- 把文本采样器包装成超级智能,分布外的悬崖终会暴露 — gerardsans · 2026-10-06