Adhiraj Ghosh 讲任务自适应采样,预训练算力倍率达 3.33 倍
pratyushmaini · x · 2026-07-24
Adhiraj Ghosh 在 Summer of Data 第 5 场分享中,讲的是 task-adaptive data curation 和 adaptive batch sampling。
- 核心思路是按任务/概念多样性来组织训练 batch,而不是简单随机采样,让预训练看到更丰富的数据分布。
- 帖子提到,这种方法在预训练中带来了 3.33x compute multiplier,也就是同样算力下训练效率显著提升。
- 原帖还给出了整场分享视频,属于比较典型的研究/工程型长内容。
「研究」频道最新
- The Stack v3 升级为 114TB、5 万亿 tokens 的最大开源代码集 — JJitsev · 2026-07-24
- HyperNet 用 LoRA 权重把事实注入冻结大模型 — rohanpaul_ai · 2026-07-24
- 研究:程序性记忆的重现独立于海马体 — ClementineDomi6 · 2026-07-24
- 独立搜索让 Fable、Sol、Grok 和 Gemini 准确率都更高 — ycombinator · 2026-07-24
- AI 正让 null results 论文更便宜,也可能稀释科研信号 — soumitrashukla9 · 2026-07-24
- GLM-5.2 博客透露,Z.ai 似乎放弃 GRPO 回到 PPO — bycloud · 2026-07-24