实测英伟达 Nemotron 3.5:30B MoE 推理速度超 250 tokens/s

Arindam_1729 · x · 2026-08-11

开发者实测了英伟达最新发布的 Nemotron 3.5 Lightning 模型。该模型为 30B 参数的 MoE 架构(激活参数 3B),专为高频、低延迟的智能体任务设计。

在 Nebius 平台上,其实际推理速度达到了惊人的 250-260 tokens/s。测试者表示,除了速度极快外,该模型的推理表现也十分出色,非常期待将其应用于更多的 Agentic 工作流中。

所属事件:NVIDIA发布Nemotron 3.5 Lightning模型与NeMo Switchyard路由库(37 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →