SAE 特征与模型记忆机制引发技术争论

关于大模型记忆机制与 SAE 可解释性的技术讨论升温:有观点质疑模型是逐字记忆训练数据、可用字符串编辑距离度量,认为实际更像是模糊记住「概念」。voooooogel 与 gleech、repligate 的讨论也显示,即使留言板内容被改写,SAE 特征仍能记住混淆手法等模式,却记不住具体帖子文本。

2026-09-05 ~ 2026-09-05 · 2 条相关