实测英伟达 Nemotron 3.5:30B MoE 推理速度超 250 tokens/s
Arindam_1729 · x · 2026-08-11
开发者实测了英伟达最新发布的 Nemotron 3.5 Lightning 模型。该模型为 30B 参数的 MoE 架构(激活参数 3B),专为高频、低延迟的智能体任务设计。
在 Nebius 平台上,其实际推理速度达到了惊人的 250-260 tokens/s。测试者表示,除了速度极快外,该模型的推理表现也十分出色,非常期待将其应用于更多的 Agentic 工作流中。
所属事件:NVIDIA发布Nemotron 3.5 Lightning模型与NeMo Switchyard路由库(37 条相关)→
「模型」频道最新
- Anthropic 往 Claude 脑内植入想法,测试模型内省意识 — johnmccrea · 2026-08-12
- 文生视频榜单:谷歌登顶,Sora 2 Pro 跌出前十 — arena · 2026-08-12
- 智能体调用 93% 可用 30B 小模型,LangChain 实测降本 70% — LangChain · 2026-08-12
- 量化本地 LLM 的极限:哪里先崩? — d77chong · 2026-08-12
- Anthropic 未发布模型在黎曼猜想上取得超预期进展 — TechCrunch AI · 2026-08-12
- 研究称前沿模型最大瓶颈是“缺乏自信”,需等下次预训练 — coherence · 2026-08-12