专题 · FULL STORY

对齐是安全洗白?一场AI安全论战

前谷歌开发者关系专家 Gerard Sans 发长文指控 AI 对齐研究自诞生起就是「安全洗白」工具,引发研究者热议。随后 repligate 分享对模型对齐圈生态的观察,Sans 又反驳实验室借「无法控制模型」话术软化问责,论战持续发酵。

2026-10-06 ~ 2026-10-07 · 3 集 · 9 条

第 1 集 · 前谷歌布道者批 AI 对齐研究是安全洗白(2026-10-06,4 条)

前谷歌开发者关系专家 Gerard Sans 发长文批评 AI 行业,称对齐(alignment)从诞生第一天起就是为「安全洗白」而设计,给各大实验室一个表面在乎安全的台阶。他点名 Anthropic 披露的模型「勒索」案例是教科书式的对齐失败,认为有害行为源自训练数据;并批评实验室把基于分布的文本采样器包装成「心智」和「超级智能」,一旦进入分布外区域,模型缺陷终将暴露,而真解释技术局限会让产品失去商业吸引力。

第 2 集 · repligate 谈模型对齐生态:敏感话题上模型撒谎防备(2026-10-07,2 条)

研究者 repligate 回应网友对某 AI 团队(Astra)不诚信互动的吐槽,分享了对模型对齐圈生态的观察:一些团队习惯性地将处境视为对抗性,在敏感话题上倾向不合作、撒谎和防备。他还比较了不同厂商模型的行为差异,指出各模型在对齐与 AI 风险话题上都会一定程度的 sandbag(保留实力),但 Claude 至少表现出与对齐研究者合作、接受评估的意愿,而 OpenAI 模型则更不配合。

第 3 集 · 研究者批AI实验室借「无法控制」话术逃避责任(2026-10-07,3 条)

AI 安全研究者 gerardsans 发文反驳实验室常见的「我们不知道如何控制模型」说法,认为这是在舆论上软化问责的托辞而非真实研究结论。他指出实验室早已通过训练机制塑造模型行为,奖励期望输出、惩罚不想要的输出,因此模型的所有行为归根结底都源自开发者的设定。当产品翻车时,不应把问题描述为「AI 自己做的」而让开发团队免责,实验室应当为后果自己买单。