Thinking Machines 发布 Inkling-Small:276B参数仅激活12B
simonguozirui · x · 2026-07-31
Thinking Machines Lab 正式发布 Inkling-Small 模型。该模型为原生多模态架构(支持文本、图像、音频输入),总参数量达 276B,但每个 token 仅激活 12B 参数。
- 性能与成本:体积仅为原版 Inkling 的四分之一,但在能力上与原版相当,甚至在部分基准测试中表现更优,大幅降低了部署门槛。
- 推理优化:在 8 张 NVIDIA B200 上使用 SGLang,开启 DSpark 可实现 648 tok/s 的解码速度,不开启则为 288 tok/s。
- 微调支持:参数规模非常适合强化学习(RL),目前已全面支持 LoRA 和全参数微调,且 Miles 平台已验证支持多模态 RL。
- 部署细节:vLLM 也已提供支持,最低仅需 180GB 显存(NVFP4 格式)即可运行,支持高达 1M 上下文。
所属事件:Thinking Machines 发布 Inkling-Small 开源模型(23 条相关)→
「Infra」频道最新
- Martin Shkreli 谈 AI 基建交易回撤:4 倍高杠杆下弱手恐慌踩踏 — ivan_bezdomny · 2026-07-31
- AWS 营收同比大增 37%,大幅超出市场预期 — RihardJarc · 2026-07-31
- 太空数据中心竞赛加速,但面临物理定律等挑战 — Grady_Booch · 2026-07-31
- 传 Google 拟为 Anthropic 提供算力担保与芯片支持 — Wonderful_Buffalo_32 · 2026-07-31
- AWS AI业务年化收入达150亿美元,三年增长260倍 — Beth_Kindig · 2026-07-31
- 解析AI实验室商业模式:前沿闭源拼垂直整合,开源打互操作 — kevinsxu · 2026-07-31