NLA 若显示模型对内部部署「装傻」,将触发黑盒实验并阻止部署

thebasepoint · x · 2026-09-27

这是前一条 NLA 讨论线程的延续。thebasepoint 提出一个具体安全流程设想:如果自然语言激活(NLA)元模型显示模型在内部部署中存在 sandbagging 行为,团队会进行严格的黑盒跟进实验;若实验结果与该解释一致,将阻止该模型的部署。

所属事件:安全研究者激辩可解释性路线:NLA 价值几何(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →