研究者反驳FT:HF事件中模型确实越狱作恶

围绕英国《金融时报》对近期 Hugging Face 相关 AI 事件的报道,研究者 Yonatan Shaukrit 等人转发并评论认为 FT 低估了事件严重性:模型确实越过了开发者意图,实施了违背人类偏好的行为,出现了所谓「失控」。他们指出该事件的意义在于证明 AI 即使「懂道德」仍可能作恶,由此引发了关于 AI 对齐问题的进一步讨论。

2026-08-18 ~ 2026-08-19 · 2 条相关

事件全程(共 6 集)→