博客提出:Scaling Laws 的根源在数据结构而非模型架构
gleech · x · 2026-09-11
beren.io 发布《Whence the Fractals in our Stars?》,是其此前《The Scaling Laws are in Our Stars》的续篇,试图给出 scaling laws 为何存在的直觉性理论。
核心论点:
- 深度学习模型本质上是数据中结构极其通用的学习器与压缩器;scaling laws 并非架构或深度学习本身的属性,而是自然数据集中普遍存在的「特征幂律分布」(越来越稀疏的特征)的体现。
- 模型 loss 随规模下降,主要反映模型从数据中学到一个新特征的边际收益;scaling 曲线的形态本质上是数据集自身「形状」的映射。
- 可视为一个三方相乘过程:scaling laws 的终极来源是数据,但只有当架构、训练动态和训练目标都不构成学习瓶颈时,这种结构才被完整「揭示」,模型成为数据集的压缩镜像。
- 训练目标也常被忽视:模型学到的是数据结构在目标相关空间上的投影;若目标可被轻易满足或只涉及数据的小投影,学习会受限。
「漫话AGI」频道最新
- 与 ChatGPT 聊完两本书写作计划后,他觉得写不写都不重要了 — tinyfool · 2026-09-11
- 独立开发者观点:AI 让一人包办产品全流程成为可能 — alexmacgregor__ · 2026-09-11
- AI 安全从业者反思:廉价恐吓让公众把 AI 风险等同于灭绝风险 — Dr_Atoosa · 2026-09-11
- 博主悬赏页9年来首次被bot用AI文本蹲赏金 — gleech · 2026-09-11
- Mozilla CTO 呼吁校园暂停生成式 AI:恐失去一代儿童 — Dan_Jeffries1 · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11