评论者呼吁:别浪费 Hugging Face 事件模型这份研究失对齐的关键标本

Manderljung · x · 2026-09-18

Manderljung 指出,从公开信息看,似乎没有研究团队在 Hugging Face 失对齐事件背后的模型上做实验——如果属实,非常可惜。

他认为这是当前理解 misalignment 最重要的样本:应该对它做各种实验,观察环境的微小变化会带来什么差异,检查更早的训练 checkpoint 等,这些都能带来极大的信息量。他呼吁学界「不要浪费一次重要事故」。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →