芝浦工大 Ozaki Scheme II 入选 CUDA 13.4,用低精度算力跑高精度计算
udmrzn · x · 2026-10-01
日本芝浦工业大学尾崎克久教授团队的计算方法「Ozaki Scheme II」被 NVIDIA 采纳,纳入 2026 年 9 月发布的 CUDA Toolkit 13.4,这是继初代 2025 年入选后的第二次。
背景:近年 GPU 为 AI 低精度计算而进化,倍精度(FP64)性能大幅倒退——B200 约 40 TFLOPS,而 Blackwell Ultra (B300) 降至 1.21.3 TFLOPS,缩水 30 倍以上,科学仿真所需的倍精度计算难以发挥硬件性能。
技术原理:Ozaki Scheme 用数学方法(误差自由变换、中国剩余定理的模运算)把 AI 向低精度运算器多次组合,在不新增硬件电路、纯软件运行于 Ampere 之后 GPU 的前提下,高效产出倍精度级结果,把 AI GPU 富余的低精度算力转化为科学计算性能。
影响:适用于气象预报、抗震设计、量子化学、新材料开发等场景;理研已将其列为富岳 NEXT 超算的开发选用手法之一,美国能源部科学项目也有采用。一项 14 年的基础研究最终写入全球计算基盘。
「Infra」频道最新
- Nvidia 授权 1500 亿美元回购,被视为押注未来需求 — YvesMulkers · 2026-10-01
- GLM 5.3 Flash 重写内核上线 RunInfra:670 tok/s、缓存命中率 99.7% — ycombinator · 2026-10-01
- Pareto 与 Engy 达成合作,将 Bittensor SN10 推理优化输出给第三方客户 — markjeffrey · 2026-10-01
- Respan 发布 Span-01 模型路由器:比单模型省 37% 成本 — ycombinator · 2026-10-01
- 实测 RTX 3090 功耗可降至 120W,推理省电又降温 — QuixiAI · 2026-10-01
- AI 当编译器:模型直出 PTX 汇编,FlashAttention 提速 1.37x — Azaliamirh · 2026-10-01