论文:语言模型到底记住了多少 约每参数 3.6 比特

pmttyji · reddit · 2026-07-07

论文提出新方法估计模型对单个数据点的记忆量,从而测量模型容量。作者将记忆形式上拆为「无意记忆」(对特定数据集的信息)与「泛化」(对真实数据生成过程的信息),在完全消除泛化后得到的总记忆量即为容量估计:GPT 式模型约每参数 3.6 比特。 在逐渐增大的数据集上训练时,模型先填满容量进行记忆,随后进入 grokking 阶段,无意记忆下降、泛化上升。研究训练了从 50 万到 15 亿参数的数百个 transformer,得到容量、数据规模与成员推断之间的一系列 scaling law。

所属事件:ICML论文:大模型每个参数约具3.6比特记忆容量(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →