为什么 GPU 训练不用 xorshift?philox 成并行随机数标配
abhi9u · x · 2026-09-25
作者 abhi9u 借 xorshift 的科普帖延伸讲解随机数生成器在 GPU 上的特殊性:
- CPU 上的经典方案:George Marsaglia 2003 年提出的 xorshift 只需三行移位和异或,实现极简,却能通过多数标准随机性测试,成为多个游戏引擎的默认 RNG。
- GPU 场景不同:传统 PRNG 是顺序状态机,适合 CPU,但在 AI 训练与推理大量使用 GPU 的场景下,关键是并行——各线程要能同时生成随机数。
- 可复现性约束:并行之外还要求给定 seed 时序列可复现,线程不能各自独立生成,这让问题更棘手。
- 业界方案:PyTorch 和 CUDA 采用的 philox RNG 就是为快速并行生成而设计的算法,作者去年曾专文介绍。
一句话结论:硬件形态决定 RNG 设计,三行的 xorshift 好用但只属于 CPU 时代。
所属事件:拆解 Philox:PyTorch GPU 并行随机数生成之道(2 条相关)→
「Infra」频道最新
- 下一代数据中心将大举落地澳大利亚,专为 Anthropic 建设配套 — mattbeane · 2026-09-25
- 高盛预测超大规模云厂商明年资本开支增 54% 至 1.2 万亿美元 — firstadopter · 2026-09-25
- 1.5 美元微调 GLiNER2 数据集打标模型,零样本 10% 提到 69% — iamrobotbear · 2026-09-25
- GB300 机架每公斤 3165 美元,单位价值已达「芬太尼级」超过大麻 — StewartalsopIII · 2026-09-25
- 从 KV Cache 到多智能体:一份循序渐进的 AI 系统设计开源指南 — blaizedsouza · 2026-09-25
- Yoav Goldberg 谈推理工程师真功夫:KV 缓存、通信、负载均衡才算入门 — yoavgo · 2026-09-25