SGLang 支持 Inkling-Small 本地运行,双节点实现 24 tok/s
ying11231 · x · 2026-08-01
SGLang 宣布正式支持在 2 台 NVIDIA DGX Spark 系统上运行 Inkling-Small 模型,设备间通过 ConnectX-7 连接。
该部署方案旨在紧凑的硬件平台上实现强大的本地智能体能力。在未开启 MTP(多 Token 预测)且并发数为 1 的测试条件下,当前设置可达到 24 tok/s 的生成速度。
「编程与Agent」频道最新
- AI Agent 接管量化交易:开发者畅想自动化套利 — doodlestein · 2026-08-01
- 实测:用大模型Agent全自动挖掘开源库RCE漏洞 — rez0__ · 2026-08-01
- Grok Build 迎重大更新:支持永久删除会话与智能诊断修复 — Kyrannio · 2026-08-01
- 单条提示词生成多人游戏,Claude 3.5 Sonnet 智能体开发实测 — TAbrodi · 2026-08-01
- 详解 AI 智能体 Loop 工程实践:30分钟掌握无人值守工作流 — Saboo_Shubham_ · 2026-08-01
- terminal-browser:让 AI Agent 直接在终端操作浏览器 — 4310sy · 2026-08-01