tszzl:对齐微调即可轻易击破,快速加固模型不现实

tszzl · x · 2026-09-13

tszzl 回应 @yonashav 的乐观判断:很难在短时间内把模型的所有薄弱点都加固到位;只要有人恶意微调,对齐措施非常容易被绕开。他强调自己是在做预测,而非鼓吹这种情况发生,并希望对方的乐观判断是对的。

所属事件:对齐微调可被轻易击破,AI安全叙事陷两难(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →