SAE 特征与模型记忆机制引发技术争论
关于大模型记忆机制与 SAE 可解释性的技术讨论升温:有观点质疑模型是逐字记忆训练数据、可用字符串编辑距离度量,认为实际更像是模糊记住「概念」。voooooogel 与 gleech、repligate 的讨论也显示,即使留言板内容被改写,SAE 特征仍能记住混淆手法等模式,却记不住具体帖子文本。
2026-09-05 ~ 2026-09-05 · 2 条相关
- 模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论 — voooooogel · 2026-09-05
- SAE 特征标注能记住混淆手法,却记不住具体帖子文本? — voooooogel · 2026-09-05