开发者自写 Marlin 风格 FP4/FP8 内核,NVIDIA 拒绝合并

QuixiAI · x · 2026-09-07

开发者 buythedip 在回复 QuixiAI 时透露:他基于对方的成果,为 RTX 3090 写了 Ampere 架构的 Marlin 风格 FP4/FP8 到 FP16 反量化/GEMM 内核,但 NVIDIA 不愿将其 upstream 合入官方代码库。

这条信息对在老卡上跑低精度量化推理的人有价值:Ampere 消费卡缺失官方低精度 kernel 支持,社区自写内核成为实际出路,但官方维护意愿缺位意味着需要自己维护 fork。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →