PyTorch 和 CUDA 可复现性指南更新,加入 CUBLAS_WORKSPACE_CONFIG
StasBekman · x · 2026-07-21
这条帖子更新了 **PyTorch/CUDA 程序的可复现性** 说明,并配了示例代码,核心是在最近一轮变更后,确定性训练/推理需要注意更多细节。 要点包括: - 在 CUDA 上下文创建前设置 `CUBLAS_WORKSPACE_CONFIG` - 启用 `torch.use_deterministic_algorithms(True)` - 关闭 `torch.backends.cudnn.benchmark` - 同时给 Python、NumPy、`torch.manual_seed` 和 `torch.cuda.manual_seed_all` 设种子 作者强调,PyTorch/CUDA 的 determinism 规则一直在演进,因此工程文档也需要同步更新。
「Infra」频道最新
- SALT 用 trie 压缩长上下文,降低 LLM 运行成本 — No_Sky9786 · 2026-07-21
- 一篇 GPU 升级指南对比 H200 和 B200,并附基准代码 — StasBekman · 2026-07-21
- ComfyUI 基准显示 NVFP4 可加速 Flux 和 Qwen-Image 等模型 — Certain-Will-2769 · 2026-07-21
- 分析称华为 Ascend 950DT 可能在能效上超过 B300 — teortaxesTex · 2026-07-21
- OpenRouter 动态路由帮 2.2 万用户节省超 10 万美元 — gajesh · 2026-07-21
- 中国 LLM 厂商 API 价格战持续加剧 — sen_o · 2026-07-21