研究者称对齐形同「安全洗白」, Labs 未真正关心安全

gerardsans · x · 2026-10-06

ML 研究者 Gerard Sans 发文批评当前 AI 行业:如果各家实验室真的解释技术原理和局限性,产品就会失去商业吸引力。他称对齐(alignment)从第一天起就是为「安全洗白」(safety washing)设计的——给实验室一个表面重视安全的出路。用户因此困惑于指令被忽略、模型跑偏,而实际上需要 harness、上百次迭代和层层校验才能让系统可靠,「你只能骗人一时」。

所属事件:前谷歌布道者批 AI 对齐研究是安全洗白(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →