模型内部信号用于训练并非总不可取
gleech · x · 2026-07-19
作者围绕经典的“Most Forbidden Technique”展开讨论:把模型内部表征用于训练信号,是否真的总是不可取。 文章认为,针对这类方法的“一刀切”反对往往过于夸张。虽然作者承认这类做法与“obfuscation(遮蔽)”相关,确实需要谨慎,但他主张:不能把“使用模型内部信息”直接等同于错误做法,关键要看具体条件。 文章结合相关文献回顾,尤其提到 *The Obfuscation Atlas* 对讨论的贡献,并计划总结在什么条件下,训练过程中使用模型内部信号是值得采用的。
「安全」频道最新
- nginx 预认证RCE与捕获覆盖溢出 — jedisct1 · 2026-07-20
- 网络安全正变成AI对AI — AryHHAry · 2026-07-20
- MCPgrade给MCP服务器打安全分 — LankyStruggle7605 · 2026-07-20
- 英国科技界呼吁三项AI改革 — alexvoica · 2026-07-20
- AI 将成为精确说服武器 — VraserX · 2026-07-20
- 本地Prompt注入防护:文本图文音频都能查 — BordairAPI · 2026-07-20