Nemotron 3 Nano Omni 本地实测:单机跑出 264 tok/s

ivan_bezdomny · x · 2026-08-03

开发者分享了在 DGX Spark 上原生运行英伟达 Nemotron-3-Nano-Omni-30B(3B 激活参数)多模态模型的实测数据。该模型在短上下文下推理速度高达 264 tok/s,预填充速度达 1300 tok/s,但在 256k 上下文时速度会降至约 57 tok/s。

模型体积仅 33GB,集成了图像、视频、音频、OCR 及工具调用能力。作者正计划将其接入 ComfyUI 工作流,打造一个完全本地化、具备视觉理解与图像生成能力的多模态智能体。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →