NVIDIA 发布 30B MoE 模型 Nemotron 3.5 Lightning,专为智能体打造
kuchaev · x · 2026-08-11
NVIDIA 发布了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的混合 Mamba-Transformer MoE 模型,激活参数仅为 3B。
该模型专为“始终在线”的智能体设计,主打处理高吞吐量的专业任务,输出速度最高可达同级别模型的 4 倍。主要特点包括:
- 内置三种推测解码机制(MTP, DFlash, DSpark)
- 针对编码、工具调用和多轮对话的智能体场景进行了训练
- 支持最高 100 万 token 的上下文,提供 BF16 和 NVFP4 精度
- 可在 Jetson、DGX Spark、Hopper 和 Blackwell 等多种架构上运行
目前,推理框架 SGLang 已提供 Day 0 支持。
所属事件:英伟达开源Nemotron模型与智能体路由工具(36 条相关)→
「Infra」频道最新
- 单张二手GPU算力比肩Claude 3 Opus,本地AI部署潜力被严重低估 — DynamicWebPaige · 2026-08-12
- CoreWeave 无服务器推理上线 Nemotron 3.5 Lightning — wandb · 2026-08-12
- AWS 发布企业级 Claude 应用网关部署参考架构 — AWS ML Blog · 2026-08-11
- NVIDIA 专家:多 token 技术已成推理优化标配 — PavloMolchanov · 2026-08-11
- 2.6 万美元双 RTX 5090 工作站主打本地跑前沿模型 — dee_hw · 2026-08-11
- NVIDIA Nemotron 3.5模型上线Crusoe,主打高并发智能体推理 — Scobleizer · 2026-08-11