Zach Mueller 征集 AIPerf 实测名单:GLM 5.3 Flash 等三款 Flash 模型将跑 NVFP4
TheZachMueller · x · 2026-10-09
Hugging Face 工程师 Zach Mueller 宣布本周末用 AIPerf 对比测试多款模型在 x8 PCIe5 的 4 Pro 与 4 Max-Q 上的推理表现,量化方案以稳定的 NVFP4 量化为底线。目前已列入候选名单的包括 GLM 5.3 Flash、DeepSeek v4 Flash 和 Qwen Flash Next,并向社区征集更多想看的模型。他还补充说明此次测试的目的是提供实用基线,为后续 backplane 版本做铺垫。
所属事件:Hugging Face 工程师周末实测多款 Flash 模型 NVFP4 推理性能(2 条相关)→
「Infra」频道最新
- Atomic Machines 出关:用「物质编译器」从代码造微机械 — Not Boring (Packy McCormick) · 2026-10-09
- Hetzner 详解云网络栈十年演进史与技术架构全貌 — cnkk · 2026-10-09
- 实测:Windows 下同时用 Intel+NVIDIA 双 GPU 跑 ComfyUI — tostane · 2026-10-09
- RTX 4090 之外再加华为 Atlas Duo 96GB,跑 Qwen 值不值? — OkFly3388 · 2026-10-09
- LiteLLM 登 GitHub 热榜:Rust 核心重写,调用 100+ LLM API 的最轻 AI 网关 — BerriAI · 2026-10-09
- NVIDIA 将在 PyTorch 大会展示 CUTLASS Python 新特性:任务调度器与编译期静态检查 — PyTorch · 2026-10-09