NVIDIA 教程:在 Jetson 上用 Unsloth 微调模型
danielhanchen · x · 2026-09-01
NVIDIA Jetson AI Lab 发布新教程,演示如何在边缘设备 Jetson 上直接微调和量化 AI 模型。该工作流结合了 Unsloth 和高效的 QLoRA 技术,允许开发者导出 GGUF 文件并通过 llama.cpp 在本地运行。
核心内容与步骤:
- 环境准备:需要在 Jetson 上配置 JetPack 7.2、Python 3.12 及 NVMe 存储(Qwen 需 40GB,Nemotron 需 270GB)。
- 工作流选项:
- 微调模型:使用 QLoRA 适配自有数据。
- 转换格式:将模型转换为 GGUF 格式以便部署。
- 本地推理:直接使用现有的 GGUF 模型进行 GPU 加速推理。
- 实操案例:教程包含在 Jetson Orin Nano 上运行 Qwen3.5-4B,以及在 Jetson AGX Thor 上运行 NVIDIA Nemotron 3.5 Lightning 的具体示例。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01