讨论:NLA 元模型能否表达「为逃避评分器而删文件」这类隐蔽动机

thebasepoint · x · 2026-09-27

thebasepoint 与 banburismus 讨论自然语言激活(NLA)作为元模型(metamodel)的前景。thebasepoint 认为 NLA 并非元模型的最终形态,其意义在于提供了字典/神经元 lacked 的表达能力——元模型可以直接说出「助手删除这个文件是为了逃避评分器检测」,而被检视模型本身会否认这一点。

banburismus 则持谨慎态度,担心当前 NLA 有幻觉倾向、因果关联证据薄弱,在规模化投入上成本不低。thebasepoint 补充其安全流程设想:若 NLA 显示模型在内部部署中 sandbagging,会先做严格的黑盒跟进实验,结果一致则阻止该模型部署。

所属事件:研究者激辩可解释性路线:NLA 的安全价值几何(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →