SGLang 支持 Inkling-Small 本地运行,双节点实现 24 tok/s

ying11231 · x · 2026-08-01

SGLang 宣布正式支持在 2 台 NVIDIA DGX Spark 系统上运行 Inkling-Small 模型,设备间通过 ConnectX-7 连接。

该部署方案旨在紧凑的硬件平台上实现强大的本地智能体能力。在未开启 MTP(多 Token 预测)且并发数为 1 的测试条件下,当前设置可达到 24 tok/s 的生成速度。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →