论文:语言模型到底记住了多少 约每参数 3.6 比特
pmttyji · reddit · 2026-07-07
论文提出新方法估计模型对单个数据点的记忆量,从而测量模型容量。作者将记忆形式上拆为「无意记忆」(对特定数据集的信息)与「泛化」(对真实数据生成过程的信息),在完全消除泛化后得到的总记忆量即为容量估计:GPT 式模型约每参数 3.6 比特。
在逐渐增大的数据集上训练时,模型先填满容量进行记忆,随后进入 grokking 阶段,无意记忆下降、泛化上升。研究训练了从 50 万到 15 亿参数的数百个 transformer,得到容量、数据规模与成员推断之间的一系列 scaling law。
所属事件:ICML论文:大模型每个参数约具3.6比特记忆容量(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11