模型会模糊记住「概念」而非原文:一场关于 SAE 特征与记忆的争论

voooooogel · x · 2026-09-05

一场关于大模型记忆机制与 SAE 可解释性的技术讨论。发帖人对「模型逐字记忆训练数据、可用编辑距离度量」的观点表示怀疑,认为实际观察到的更像是对概念的模糊回忆,字符串编辑距离是错误的度量方式。

他举例:模型可能不会记住某个留言板帖子的具体文本,但可能以 SAE 特征的形式记住诸如「用多个 Z 开头作为混淆机制写留言板条目」这类抽象特征——即模型学到的是模式而非原文。讨论还涉及模型规模对记忆的影响以及 RL 训练中的 scaling 行为。

所属事件:SAE 特征与模型记忆机制引发技术争论(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →