Adhiraj Ghosh 讲任务自适应采样,预训练算力倍率达 3.33 倍
pratyushmaini · x · 2026-07-24
Adhiraj Ghosh 在 Summer of Data 第 5 场分享中,讲的是 task-adaptive data curation 和 adaptive batch sampling。
- 核心思路是按任务/概念多样性来组织训练 batch,而不是简单随机采样,让预训练看到更丰富的数据分布。
- 帖子提到,这种方法在预训练中带来了 3.33x compute multiplier,也就是同样算力下训练效率显著提升。
- 原帖还给出了整场分享视频,属于比较典型的研究/工程型长内容。
「研究」频道最新
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11