NVIDIA 本地推理优化:llama.cpp 提速至 1.9 倍

NVIDIA 在 IFA 2026 宣布多项本地 AI 进展,并为 RTX 平台发布新的推理优化:在 GeForce RTX 5090 上 llama.cpp 吞吐最高提升 1.9 倍,vLLM 也有约 1.2 倍提速,相关更新可通过 LM Studio 等渠道获取。此外,RTX Spark 设备预计 10 月上市,进一步布局本地 AI 生态。

2026-09-04 ~ 2026-09-05 · 2 条相关