模型内部信号用于训练并非总不可取
gleech · x · 2026-07-19
作者围绕经典的“Most Forbidden Technique”展开讨论:把模型内部表征用于训练信号,是否真的总是不可取。
文章认为,针对这类方法的“一刀切”反对往往过于夸张。虽然作者承认这类做法与“obfuscation(遮蔽)”相关,确实需要谨慎,但他主张:不能把“使用模型内部信息”直接等同于错误做法,关键要看具体条件。
文章结合相关文献回顾,尤其提到 The Obfuscation Atlas 对讨论的贡献,并计划总结在什么条件下,训练过程中使用模型内部信号是值得采用的。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11