Unsloth 新玩法:2 分钟在 DGX Spark 上把 Qwen 微调成决策模型
danielhanchen · x · 2026-10-10
- Unsloth 发布了「训练你自己的 Decision Model」教程,并推出本地应用 Unsloth Desktop,可将 Qwen、Gemma 等开源模型微调为输出「选择+校准概率」的决策模型,类似 Jev、Laya、Clef。
- 方法:用 Clef head + LoRA(r=64)只训练 1 个 epoch,即把接近随机水平的 30-37% 准确率提升到 78-81%(BANKING77 从 1-7% 提到 58-74%)。
- 实测成本很低:Qwen3.5-0.8B 仅需 4GB 显存/42 分钟,Qwen3.5-2B 8GB/40 分钟,Llama 3.2 3B 30 分钟即可达 79% holdout 准确率。
- 训练数据混合 12 个来源(含 agnews、MMLU、promptinjections 等),测试集 3000 条并做了去污染;有推友展示在单台 DGX Spark 上约 2 分钟完成微调。
「编程与Agent」频道最新
- Google 面试改革:新增 Code Comprehension 轮,用 Gemini 考你能否识破 AI — burny_tech · 2026-10-10
- 月账单 1.14 万美元查不清去向:一个团队的 LLM 成本失控复盘 — vigilAPI · 2026-10-10
- 实测豆包工作画布:一张形象图长出 VI 手册、电商页与整套 Deck — xiaohu · 2026-10-10
- 用 Codex 迁移 5.5TB 图片视频到 AWS,开发者感叹不再亲自动手 — CtrlAltDwayne · 2026-10-10
- Hermes Kanban 上线:用看板管理多 Agent 任务与交接 — Teknium · 2026-10-10
- Agent 时代 Jupyter Notebook 过时了吗?数据科学家反思 cell 工作流 — Economy_Vacation_504 · 2026-10-10