英伟达实现百万级矩阵分解,单卡显存容量翻倍
marc_stampfli · x · 2026-07-30
NVIDIA 研究团队发表了一项关于加速对称非负矩阵分解的研究,成功将计算规模扩展至 100 万×100 万 的矩阵,并跨 64 块 GB200 GPU 进行分布式运算。
技术突破
- 内存优化:通过迹恒等式重构消除了所有 $n \times n$ 的中间矩阵,使单张 GPU 的处理容量几乎翻倍,单卡可处理规模达 $n \approx 10^5$。
- 算法评估:系统性测试了 7 个算法族(超 30 种配置)。在百万级极限规模下,有 5 种 AdaGrad 家族的方法依然能够收敛。
- 场景表现:在尾部依赖性频谱中,Block-SVRG AdaptGrow 算法凭借更低的单次迭代成本胜出;而在主导低秩相关性频谱中,全批量 AdaGrad 表现最佳。
「Infra」频道最新
- CtrlS 建设数据中心容量逼近印度历史总和 — shashib · 2026-07-30
- 放弃 NVIDIA?双路 AMD R9700 搭建本地 AI 算力实测探讨 — Syosse-CH · 2026-07-30
- 16GB内存即可本地跑Gemma 4:零成本完全离线配置教程 — FinanceYF5 · 2026-07-30
- 4090+5060 Ti 混合推理实测:122B 模型跑出 37 t/s — Dry_Long3157 · 2026-07-30
- OpenAI 拟吞全球 40% 内存产能,算力正重塑硬件所有权 — Shimano-No-Kyoken · 2026-07-30
- AI 巨头被指隐瞒 1.65 万亿美元表外债务,堪比安然财务丑闻 — marigo · 2026-07-30