NVIDIA 教如何在 Jetson 上本地跑 Gemma 和 Qwen
NVIDIA Developer · youtube · 2026-07-29
NVIDIA Jetson AI Lab 这场直播讲的是如何在 Jetson 设备上本地运行开源 GenAI,不依赖云端。
- 演示了如何把 Gemma、Qwen 这类开源模型直接跑在设备上,并完成端到端部署。
- 对比了三种常见推理栈:Ollama 适合快速原型,vLLM 适合更高吞吐的服务化部署,llama.cpp 更适合轻量边缘场景。
- 还会讲 Jetson 上的模型选择、容器化与性能调优,重点涉及 Orin / Thor,以及 量化、speculative decoding 等性能手段。
- 现场还有 Reachy Mini 的实时演示,展示开源模型在边缘端跑通的实际效果。
「Infra」频道最新
- H100 租赁价升至每小时 2.75 美元,算力市场继续收紧 — BenBajarin · 2026-07-29
- Andy Masley 反驳外界把他的数据中心观点简化成 prompt 成本 — AndyMasley · 2026-07-29
- 本地 LLM 应用开发者总在重复搭建同一套优化栈 — tctheking1 · 2026-07-29
- 一段新手友好视频讲透 LLM 的 5 种 GPU 优化法 — 2C_ornot2C · 2026-07-29
- Jon Durbin 用每小时不到 10 美元预训练 20B MoE — const_reborn · 2026-07-29
- 本地部署算力方案:魔改版 3080 20GB 混搭 3090 划算吗? — YourNightmar31 · 2026-07-29