256k上下文推理跑到100 tok/s

QuixiAI · x · 2026-07-19

展示了一个推理部署结果:在 **2 张 Arc Pro B60** 上,使用 **QuixiCore SYCL kernel** 提供 **35B-A3B** 模型的 **NVFP4** 推理,速度达到 **100 tok/s**。 这条信息的重点不在模型本身,而在于:它给出了一个较具体的 **长上下文(256k)+ 显存/硬件 + 内核优化** 的组合案例,可作为本地/端侧推理与性能调优的参考。

所属事件:双卡 Arc Pro B60 跑 35B 模型推理速度达 100 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →