Modal 接入 Inkling并主打 DFlash 加速

Modal 已将 Thinky Machines 发布的 Inkling 接入 Auto Endpoints,并采用按 token 计费。现有帖子显示,这次更新更值得关注的不是模型本身,而是 Modal 围绕推理部署给出的加速方案:按转引的官方说法,Modal 为 Inkling 训练了定制的 DFlash speculator,并与 SGLang 结合使用。

关键细节

多条帖子一致提到,Inkling 已可在 Modal 上调用。重复出现的实现信息包括:Modal 为该模型专门训练了自定义 DFlash speculator,这套方案运行在 SGLang 上;转述内容还提到,Modal 感谢了 SGLang 团队在优化上的支持。

性能说法与边界

按帖子转引的 Modal 口径,这一部署方案可带来 67% 更高的吞吐和更好的交互性。另有转述称,Modal 认为其训练的 DFlash speculator 在推理速度上快于 MTP。不过,现有材料没有给出更完整的测试条件、基线配置或独立复现结果,因此目前能确认的仍主要是 Modal 自述的性能说法。

2026-07-16 ~ 2026-07-16 · 5 条相关