Inkling 表现与相关架构猜测升温

7 月 16 日,@nrehiew 围绕新近发布的 Inkling 连续发帖,先谈小模型成绩与产品定位,再延伸到一套相关前沿架构的注意力、MoE 和训练信号设计。之所以引发关注,在于两个问题同时被拉到台前:一个约 3.5 倍更小的模型为何还能打出异常强的成绩,以及超大规模 MoE 是否正在采用不同于常见路线的结构取舍。

Inkling 的表现与定位

@nrehiew 认为,Inkling 更像通用目的推理模型,而不是纯代码智能体,这与其依托 Tinker 平台的商业模式相符;他还把其策略取向类比为更接近 Cohere。对比表里,TerminalBench、SimpleQA 等任务在他看来是观察模型能力依赖关系的有用切口,也构成了他判断 Inkling small“强得离谱”的主要依据之一。

架构拆解中的关键信息

在另一组分析里,@nrehiew 拆解了一套疑似前沿模型的设计:注意力采用 sliding window,并在 KV 与 residual 路径上加入基础 1D 卷积;位置编码则完全不用 RoPE,改为基于距离收集的相对位置偏置。MoE 方面,他汇总到的数字包括总参数约 975B、激活参数约 41B、训练数据约 45T 个多模态 token,并指出相较 Dsv3,其 active 参数和 token 规模都更大。

推测与未证实部分

对于一种“按 token 调整成本”的训练或推理机制,@nrehiew 猜测其本质可能是按“思考强度”调整长度惩罚,从而塑造出更压缩的 CoT 表达风格;他明确说明这只是基于结果的推断,并非官方确认。另有一条由 @burnytech 转发的讨论补充了社区判断:在 1T+ 级模型上 muP 可能重新重要,而偏低的稀疏性也可能与硬件约束或较低专家并行有关,这些同样不属于模型团队正式披露。

2026-07-16 ~ 2026-07-16 · 7 条相关

事件全程(共 3 集)→

一手来源