前谷歌布道者批 AI 对齐研究是安全洗白

前谷歌开发者关系专家 Gerard Sans 发长文批评 AI 行业,称对齐(alignment)从诞生第一天起就是为「安全洗白」而设计,给各大实验室一个表面在乎安全的台阶。他点名 Anthropic 披露的模型「勒索」案例是教科书式的对齐失败,认为有害行为源自训练数据;并批评实验室把基于分布的文本采样器包装成「心智」和「超级智能」,一旦进入分布外区域,模型缺陷终将暴露,而真解释技术局限会让产品失去商业吸引力。

2026-10-06 ~ 2026-10-06 · 4 条相关