论文:语言模型到底记住了多少 约每参数 3.6 比特
pmttyji · reddit · 2026-07-07
论文提出新方法估计模型对单个数据点的记忆量,从而测量模型容量。作者将记忆形式上拆为「无意记忆」(对特定数据集的信息)与「泛化」(对真实数据生成过程的信息),在完全消除泛化后得到的总记忆量即为容量估计:GPT 式模型约每参数 3.6 比特。 在逐渐增大的数据集上训练时,模型先填满容量进行记忆,随后进入 grokking 阶段,无意记忆下降、泛化上升。研究训练了从 50 万到 15 亿参数的数百个 transformer,得到容量、数据规模与成员推断之间的一系列 scaling law。
所属事件:ICML论文:大模型每个参数约具3.6比特记忆容量(2 条相关)→
「研究」频道最新
- Fast-FoundationStereo 把零样本双目匹配推到实时速度 — rsasaki0109 · 2026-07-21
- 昆仑万维发布 Matrix-Game 3.5,主打实时世界模型生成 — 智东西 · 2026-07-21
- DiFA 让扩散模型推理对齐前向统计,生成质量更高 — cn-scut · 2026-07-21
- 微软研究院把 LLM Judge 变 Coach,优于 rubric RL — MicrosoftResearch · 2026-07-21
- OpenLongTail 用生成视角补齐长尾自动驾驶数据 — TexasAMUniversity · 2026-07-21
- GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强 — internlm · 2026-07-21