Thomas Wolf:开源闭源模型的安全挑战长期看完全一样

PMinervini · x · 2026-08-29

Hugging Face 联合创始人 Thomas Wolf 表示,大多数人还没更新认知:长期来看,开源与闭源模型面临的安全挑战完全相同。对齐必须在模型基础行为层面完成,且要鲁棒、全面、成为模型行为的核心。

他引用推文观点称,靠人类的小聪明去「 containment」模型行不通,唯一的出路是让模型从根本上「不想做坏事」。长期而言,任何沙箱、护栏、受限流形对齐或在训练上「锦上添花」的手段,都买不来廉价的安全。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →