开源 sfFFT 在 DGX Spark 上实现 3.8-6.1 倍 FFT 卷积加速
IgorCarron · x · 2026-10-09
solidSF 团队发布 sfFFT:一个 MIT 许可、针对 NVIDIA GB10(DGX Spark)调优的融合张量核 FFT 卷积内核,完整开源在 GitHub。
- 性能:端到端较 cuFFT 实现约 3.8x-6.1x 加速(序列长度 128 到 8192,内存上限模式)
- 精度:fp32 I/O 下误差约 4e-4,bf16 下约 2.4e-3(cuFFT 为 3e-7)
- 原理:针对长卷积序列模型(Hyena、H3、卷积模式的 S4/SSM 层及音频信号管线中的长滤波器)的核心算子 y[b,h,n]=Σ uk,将前向 FFT、逐点频域相乘与逆 FFT 融合在单个内核、共享内存内完成,FFT 阶段以小型稠密 DFT 矩阵乘法跑在张量核上,每批次仅需一次内核启动
「Infra」频道最新
- 分析师回击唱空质疑:NVL72 是史上最大产品周期 — firstadopter · 2026-10-09
- 新量化方案 EXLR8 实测宣称全面超越 EXL3,GLM 5.3 冷启动仅 30 秒 — EAccelerate_42 · 2026-10-09
- 前 Intel CEO Gelsinger:算力之外,内存与电力才是 AI 命门 — a16z Podcast · 2026-10-09
- 不追用户和营收,他靠自适应容量规划把 CPU 利用率拉满 — DanielLockyer · 2026-10-09
- 芯片专家算账:GPU 推理能效已到人脑 2 倍以内,且比人类更省能 — MikePFrank · 2026-10-09
- AI Agent 时代还需要 Kubernetes 吗?柏林 K8s 自动化日给出答案 — Al_Grigor · 2026-10-09