专题 · FULL STORY

Thinking Machines首发Inkling实测翻车

Thinking Machines Lab发布了首个开权重模型Inkling。尽管发布初期引发了关于架构和定位的猜测与热议,但多位用户实测后反馈其表现粗糙,遭遇翻车。

2026-07-16 ~ 2026-07-17 · 3 集 · 178 条

第 1 集 · Thinking Machines 首发开权重 Inkling(2026-07-16,169 条)

Thinking Machines 发布了首个开权重模型系列的首作 Inkling,并由官方账号同步介绍其已可在 Tinker 上微调、在 Playground 中体验。之所以迅速引发关注,一方面是多条帖子把它概括为 975B 总参数、41B 激活参数、支持 100 万上下文窗口的多模态 MoE;另一方面,发布当天就接入工具与平台生态,显示出较强的产品化节奏。

关键细节

官方称,Inkling 能在文本、图像、音频上进行高效推理,并表示完整权重会开放。多条转述模型卡的帖子称,它约为 1T 参数级别,采用 Apache-2 许可,支持 100 万 token 上下文;训练从零开始,训练数据包含 48T tokens 的文本、图像和音频。官方随后补充,Inkling 只是一个系列的开始,训练配方相近的 Inkling-Small 已被提前披露,后续还会继续放出完整权重。

上线与生态

除 Tinker 与 Playground 外,@YuchenjUW 转述 Databricks 已作为 Inkling 的 Day 0 发布合作伙伴提供该模型。官方还贴出 Hugging Face 上的 thinkingmachines/Inkling 趋势条目,页面将其标注为 image-text-to-text,并显示同时支持 audio-text-to-text。

各方评价

性能定位上,@natolambert 根据模型卡和基准信息判断,Inkling 相比 Nemotron Ultra 有明显提升。@deedydas 将其称为“中国之外最强”的开权重模型。@bindureddy 的态度更谨慎一些,他认为至少美国开源权重阵营终于出现了一个值得认真做基准测试的新模型。

还有 149 条相关讨论 →

第 2 集 · Inkling 表现与相关架构猜测升温(2026-07-16,7 条)

7 月 16 日,@nrehiew 围绕新近发布的 Inkling 连续发帖,先谈小模型成绩与产品定位,再延伸到一套相关前沿架构的注意力、MoE 和训练信号设计。之所以引发关注,在于两个问题同时被拉到台前:一个约 3.5 倍更小的模型为何还能打出异常强的成绩,以及超大规模 MoE 是否正在采用不同于常见路线的结构取舍。

Inkling 的表现与定位

@nrehiew 认为,Inkling 更像通用目的推理模型,而不是纯代码智能体,这与其依托 Tinker 平台的商业模式相符;他还把其策略取向类比为更接近 Cohere。对比表里,TerminalBench、SimpleQA 等任务在他看来是观察模型能力依赖关系的有用切口,也构成了他判断 Inkling small“强得离谱”的主要依据之一。

架构拆解中的关键信息

在另一组分析里,@nrehiew 拆解了一套疑似前沿模型的设计:注意力采用 sliding window,并在 KV 与 residual 路径上加入基础 1D 卷积;位置编码则完全不用 RoPE,改为基于距离收集的相对位置偏置。MoE 方面,他汇总到的数字包括总参数约 975B、激活参数约 41B、训练数据约 45T 个多模态 token,并指出相较 Dsv3,其 active 参数和 token 规模都更大。

推测与未证实部分

对于一种“按 token 调整成本”的训练或推理机制,@nrehiew 猜测其本质可能是按“思考强度”调整长度惩罚,从而塑造出更压缩的 CoT 表达风格;他明确说明这只是基于结果的推断,并非官方确认。另有一条由 @burnytech 转发的讨论补充了社区判断:在 1T+ 级模型上 muP 可能重新重要,而偏低的稀疏性也可能与硬件约束或较低专家并行有关,这些同样不属于模型团队正式披露。

第 3 集 · 新开源模型 Inkling 实测表现翻车(2026-07-16,2 条)

尽管 Thinking Machines Lab 推出的新开源模型 Inkling 引发了社区关注,但实际测试反馈不佳。多位用户试用后指出,该模型目前表现粗糙且不稳定,即使调至最高档也难以正常工作。在简单请求中其思维链容易发散,整体能力与前沿的中文开源模型相比仍存在明显差距。