工程实践:混合精度矩阵乘法 mxfp8 与 mxfp4 提速
zephyr_z9 · x · 2026-08-27
讨论指出,mxfp8 与 mxfp4 结合的矩阵乘法性能优于常规 mxfp8,被视为值得关注的工程优化。通过 2 倍激活获取并发处理缩放侧车,以匹配 fp4 的原生元素尺寸,这一实现并不简单。此外,Jalapeno 芯片在 A0 硅片上凭借移植的 DeepSeek 非推测解码实现击败了 VR200,且程序执行速度更快。
「Infra」频道最新
- GLM-5.3-Flash 本地运行指南:128GB 内存跑 3-bit 量化 — StefanoGogioso · 2026-08-27
- X Grok Bot 提供顶配 Linux 虚拟机给 Agent 用 — vista8 · 2026-08-27
- Cloudflare 推出 Computer:Agent 的虚拟文件系统 — craigsdennis · 2026-08-27
- 呼吁社区推广 LoRA 分发以节省下载带宽 — Borkato · 2026-08-27
- AI 算力加剧内存短缺,Android 拟设应用新限制 — TechCrunch AI · 2026-08-27
- GLM-5.3-Flash 本地部署实测:206 tok/s 与 1M 上下文 — funding__secured · 2026-08-27