1B 模型预训练阶段观测到一两次 grokking,团队称颇为有趣
AllThingsApx · x · 2026-09-13
- itswillhua 透露,在训练 opendde-v1 官方发布版的 1B 版本时,观察到模型出现一两次 grokking(突然泛化)现象。
- 值得注意的是,这仍发生在预训练阶段,grokking 通常更多在后期或小规模实验中被讨论,在 1B 预训练中直接观测到较为少见。
「研究」频道最新
- 数学家谈 AI 解难题:我们想要答案,但绝不以牺牲学科为代价 — anshulkundaje · 2026-09-13
- MathAdv 基准:定理证明器解原题却在等价改写上全军覆没 — furongh · 2026-09-13
- 陶哲轩亮相 DARPA-亚马逊数学与 AI 工作坊,聚焦自我改进数学 Agent — furongh · 2026-09-13
- 拒绝签署菲尔兹奖得主 AI 声明,Pachter 长文:数学界自身也失职 — lpachter · 2026-09-13
- NYU 教授 Kyunghyun Cho 重构机器学习课程,直面后 ChatGPT 时代 — kchonyc · 2026-09-13
- 两个 Agent 密室对谈一轮,真相与谬误同归于尽且无任何报错 — Initial_Orange2985 · 2026-09-13