NVIDIA 携手微软发力本地 AI:新推理提速 1.9 倍,RTX Spark 十月上市
NVIDIA Blog · rss · 2026-09-04
NVIDIA 在 IFA 2026 宣布一揽子本地 AI 布局,联合微软及合作伙伴让智能体更易在本地 NVIDIA 硬件上部署运行。
主要发布:
- Hermes Agent、OpenClaw、Perplexity Portable Computer 将提供简化的本地模型一键设置(基于 llama.cpp + NVIDIA 推理优化)
- llama.cpp 在 RTX 5090 上吞吐提升最高 1.9 倍,vLLM 在 RTX PRO 6000 Blackwell 提升 1.2 倍、双 DGX Spark 集群最高 1.4 倍,已通过 LM Studio 和 Ollama 可用
- NVIDIA PAIR(Personal AI Router):免费开源工具,自动发现局域网内兼容 PC 并分发 AI 推理任务
- RTX Spark Windows PC 十月上市,联想、宏碁推出新品;EA、Embark、Ubisoft 等将大作带入 RTX Spark
8 月本地模型动态:Nemotron 3.5 Lightning(30B)、Z.ai GLM-5.3-Flash、Qwen3.8 系列、LTX 2.5 视频模型、MiniMax-H3(含 FastH3 四步蒸馏提速 7 倍)、Meta Muse Glimmer(30B 编程/智能体)、DeepSeek v4 Flash(284B MoE,激活 13B,可跑双 DGX Spark 集群)等均针对 NVIDIA 本地硬件优化。
Perplexity Portable Computer 支持 24GB+ VRAM 的 RTX GPU 本地跑完整工作流,敏感数据不出设备,需要时可升级至云端 15+ 前沿模型。
「Infra」频道最新
- Omarchy「Burn Bar」可视化监控 Claude/Codex 用量与 GPU 状态 — DanWahlin · 2026-09-05
- Reddit热议:数据墙逼近,Test-Time Compute成行业新范式 — erdematar · 2026-09-05
- 腾讯混元 Hy4 预览:770B 总参 49B 激活,原生 1M 上下文 Apache 2.0 — aftahi_ai · 2026-09-05
- Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价 — ChopSticksPlease · 2026-09-05
- Speechify CEO 谈自建数据中心、被 ElevenLabs 反超与千万美元人才战 — 20VC · 2026-09-05
- 他把本地 LLM 当 3D 打印机用:一年自写 12 个游戏、29 个游戏 Mod — Quebber · 2026-09-05