开发者自写 Marlin 风格 FP4/FP8 内核,NVIDIA 拒绝合并
QuixiAI · x · 2026-09-07
开发者 buythedip 在回复 QuixiAI 时透露:他基于对方的成果,为 RTX 3090 写了 Ampere 架构的 Marlin 风格 FP4/FP8 到 FP16 反量化/GEMM 内核,但 NVIDIA 不愿将其 upstream 合入官方代码库。
这条信息对在老卡上跑低精度量化推理的人有价值:Ampere 消费卡缺失官方低精度 kernel 支持,社区自写内核成为实际出路,但官方维护意愿缺位意味着需要自己维护 fork。
「Infra」频道最新
- FP8/FP4 实际加速仅约 1.5x 与 2x,远低于理论值 — scaling01 · 2026-09-07
- 北方华创展示 64 层 3D DRAM 关键刻蚀工艺,绕开 EUV 延续密度扩展 — pstAsiatech · 2026-09-07
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- 本周 AI 必读:OpenAI 研究加速报告与 Broadcom 167 亿 AI 芯片营收 — VibeMarketer_ · 2026-09-07
- 端侧Android agent实测:Gemma 4 E2B实时仅2.6 tok/s,回放却达11 — HowDevelop · 2026-09-07
- 预测:OpenAI 明年初 agent 算力开销或超全体员工薪资 — haider1 · 2026-09-07