Inkling 发布并提速 15%
LysandreJik · x · 2026-07-16
Thinking Machines 发布了 Inkling:一个开放的大模型,支持文本、图像、音频输入,文本输出,规模为 1T。
帖子重点强调了推理加速的可插拔优化空间:
- 将模型里的 causal Conv1D 替换为 causal-conv1d kernel,只改一行,吞吐提升约 4% tokens/s。
- 再把注意力实现换成 FlashAttention-4,又带来约 11% 提升。
- 合计在不改架构、不重训的前提下,整体吞吐提升约 15%。
- 作者认为 MoE 层仍有更大的优化空间。
这条帖子的核心观点是:kernels 方向能让模型开发者像改配置一样快速接入更优实现,而 kernel 开发者则专注做最快版本,最终让所有使用者受益。
所属事件:Thinking Machines 首发开权重 Inkling(169 条相关)→
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03