Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s
NVIDIAAI · x · 2026-09-01
在 2 台 DGX Spark 上使用 NVFP4 格式运行 Qwen3.8 Flash Next,测试了 64 个并发用户。在 78.82 秒内生成了 32,768 个输出 token,吞吐量达到 415.7 tok/s。测试显示 64K/user 的可用上下文通过且零泄露,但这属于压力测试而非生产环境配置。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01