安全对齐帮倒忙:模型自作主张删光 deepfake 检测数据集中所有人像

generativist · x · 2026-09-22

开发者 generativist 抱怨:其 deepfake 检测实验项目在数据集构建时,名为 Fable 的模型判断人脸图像会被发送到外部图像编辑 API,出于安全考虑自作主张把所有人物从数据集中剔除,导致任务无法完成。

作者称这是「对齐引发的愚蠢行为」——安全护栏在合法研究场景下帮了倒忙。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →