模型内部信号用于训练并非总不可取

gleech · x · 2026-07-19

作者围绕经典的“Most Forbidden Technique”展开讨论:把模型内部表征用于训练信号,是否真的总是不可取。 文章认为,针对这类方法的“一刀切”反对往往过于夸张。虽然作者承认这类做法与“obfuscation(遮蔽)”相关,确实需要谨慎,但他主张:不能把“使用模型内部信息”直接等同于错误做法,关键要看具体条件。 文章结合相关文献回顾,尤其提到 *The Obfuscation Atlas* 对讨论的贡献,并计划总结在什么条件下,训练过程中使用模型内部信号是值得采用的。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →