Inkling模型参数与架构细节及SGLang支持
BanghuaZ · x · 2026-07-16
Thinking Machines 推出的开源模型 Inkling 总参数量达 975B,活跃参数为 41B(MoE 架构),支持最高 100 万上下文,原生具备文本、图像和音频推理能力。
架构与推理优化:
- 采用全新架构,包括 ShortConv、相对位置编码注意力机制和共享专家 MoE。
- SGLang 已提供全面支持:包含 PD 分离、多 LoRA 服务、HiCache,以及由 Modal 训练的 DFlash checkpoint。
- 实现了 prefill 阶段的全 CUDA graph 优化和 MXFP8 KV cache。
所属事件:Thinking Machines 首发开权重 Inkling(169 条相关)→
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03