276B参数MoE模型可跑单卡,vLLM作者赞Inkling-Small
woosuk_k · x · 2026-07-31
vLLM 作者 Woosuk Kwon 转发并高度评价了 Thinkymachines 发布的 Inkling-Small 模型,指出其体积小到足以在单张 NVIDIA B300 加速卡上运行,并认为它可能是同级别模型中表现最好的。
根据被引用的 vLLM 官方推文,Inkling-Small 总参数量达 276B,激活参数为 12B。该模型原生支持文本、图像和音频输入,具备 100 万 token 的上下文窗口。目前其权重已开放,并针对 Blackwell 架构提供了 Day 0 的 vLLM 优化支持。
所属事件:Thinking Machines 发布开源模型 Inkling-Small(19 条相关)→
「Infra」频道最新
- 开源项目收录 LLM 部署隐蔽陷阱 — alexcovo_eth · 2026-07-31
- 解码速度达 1万 token/秒,会解锁哪些 LLM 新场景? — LivingSwitch · 2026-07-31
- 推理优化带来10倍以上性能提升,GPU算力或重演暗光纤革命 — chandan1_ · 2026-07-31
- 斯坦福学者提出用「每瓦特智能」衡量 AI 效率 — StanfordAILab · 2026-07-31
- 数据中心耗水问题引关注:新一期播客探讨 — AndyMasley · 2026-07-31
- DeepSeek计划建设1GW数据中心,Anthropic目标9-10GW — zephyr_z9 · 2026-07-31