Nemotron 3 Nano Omni 本地实测:单机跑出 264 tok/s
ivan_bezdomny · x · 2026-08-03
开发者分享了在 DGX Spark 上原生运行英伟达 Nemotron-3-Nano-Omni-30B(3B 激活参数)多模态模型的实测数据。该模型在短上下文下推理速度高达 264 tok/s,预填充速度达 1300 tok/s,但在 256k 上下文时速度会降至约 57 tok/s。
模型体积仅 33GB,集成了图像、视频、音频、OCR 及工具调用能力。作者正计划将其接入 ComfyUI 工作流,打造一个完全本地化、具备视觉理解与图像生成能力的多模态智能体。
「Infra」频道最新
- AI 工程师必看:LLM 推理部署与优化 10 周实战路线图 — _jaydeepkarale · 2026-08-03
- 应用开发者应自研端侧模型:将算力下放给用户 — abacaj · 2026-08-03
- 全球AI算力将达2亿枚H100,Agent循环加速ASI进程 — 新智元 · 2026-08-03
- tinybox 推出双卡版主机,跑 DeepSeek 达 245 tok/s — AccBalanced · 2026-08-03
- Agent 多次工具调用导致 KV Cache 失效的排查与探讨 — CentrifugalMalaise · 2026-08-03
- Wafer 用 AMD MI355X 服务 Kimi K3,吞吐提升 3.8 倍、成本降 71% — SumitGup · 2026-08-03