用可解释性探针做隐私友好的模型监控,避免泄露输出

anpaure · x · 2026-09-02

安全研究者提出一个思路:如果需要一个 monitor 来检查某方的模型是否在做坏事,可以基于可解释性方法训练一个探针来检测,好处是这样不需要获取该方的模型输出,避免输出内容泄露。

这是在讨论算力/模型验证机制的 caveat 时提出的延伸想法,作者本人正在从事验证相关研究。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →