Inkling 开放模型支持 1M 上下文
simonguozirui · x · 2026-07-16
Inkling 的首个开放模型发布,强调原生多模态推理和开放栈支持。
关键信息
- 模型规模:975B total / 41B active MoE
- 上下文长度:最高 1M context
- 能力:原生支持 文本、图像、音频 推理
- 发布形态:开放权重,支持 serving 和 RL
工程与部署支持
- SGLang 和 Miles 在 Day 0 就提供推理支持
- 采用新架构:ShortConv、带相对位置编码的 attention、shared expert sink MoE
- 推理侧做了深度优化:prefill full CUDA graph、MXFP8 KV cache
- 训练侧支持 full parameter 和 LoRA RL,并通过自定义 Megatron 后端、routing replay、跨运行时参数同步等机制保证训练/推理一致性
整体看,这条更像是一次“模型 + 推理/训练栈”同步上线的开放模型发布。
所属事件:Thinking Machines 首发开权重 Inkling(169 条相关)→
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03