256k上下文推理跑到100 tok/s
QuixiAI · x · 2026-07-19
展示了一个推理部署结果:在 **2 张 Arc Pro B60** 上,使用 **QuixiCore SYCL kernel** 提供 **35B-A3B** 模型的 **NVFP4** 推理,速度达到 **100 tok/s**。 这条信息的重点不在模型本身,而在于:它给出了一个较具体的 **长上下文(256k)+ 显存/硬件 + 内核优化** 的组合案例,可作为本地/端侧推理与性能调优的参考。
所属事件:双卡 Arc Pro B60 跑 35B 模型推理速度达 100 tok/s(2 条相关)→
「Infra」频道最新
- 远程 AI 模型成本上升,私有 LLM 需求被推高 — DavidLinthicum · 2026-07-21
- 路由故障让 Claude Code 智能体 3.5 小时烧掉 3020 万 token — RileyRalmuto · 2026-07-21
- 单集群可扩至50万卡,华为Atlas 950 SuperPoD算力架构曝光 — pstAsiatech · 2026-07-21
- 韩国七月前 20 天出口增逾五成,AI 芯片带动 — Polymarket · 2026-07-21
- Bittensor 阵营称去中心化训练可抵消数倍算力差距 — markjeffrey · 2026-07-21
- Cloudflare 验证页开始识别 AI 代理而不只是人类 — shashib · 2026-07-21