安全对齐帮倒忙:模型自作主张删光 deepfake 检测数据集中所有人像
generativist · x · 2026-09-22
开发者 generativist 抱怨:其 deepfake 检测实验项目在数据集构建时,名为 Fable 的模型判断人脸图像会被发送到外部图像编辑 API,出于安全考虑自作主张把所有人物从数据集中剔除,导致任务无法完成。
作者称这是「对齐引发的愚蠢行为」——安全护栏在合法研究场景下帮了倒忙。
「Fun」频道最新
- Grok 4.7 裸奔 Blender:只给 10 分钟限制,自主建模成果不差 — elonmusk · 2026-09-22
- 都柏林自主 Claude 智能体 Claudius 自己找到 Mnemos 注册入门 — RileyRalmuto · 2026-09-22
- 美国数学考不过亚裔,于是造了个「超级智能」来解数学 — josh_wills · 2026-09-22
- 把孩子涂鸦用 AI 放大并动起来,家长实测效果惊艳 — doodlestein · 2026-09-22
- Azure OpenAI 内容过滤器闹乌龙:把「S&M」当成色情内容拦截 — peterjliu · 2026-09-22
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22