Unsloth 用 4GB 显存把 Qwen3.5 0.8B 决策准确率从 20.7% 提到 74.3%
kalyan_kpl · x · 2026-10-08
Unsloth 团队宣布可在本地训练你自己的"决策模型":他们用 Clef head + LoRA(r=64)微调 Qwen3.5 0.8B 一个 epoch,在 3 个决策基准上的综合准确率从 20.7% 提升到 74.3%,下游准确率从 30–37% 提至 78%,全程仅需 4GB 显存。
- 方法:使用 Unsloth + LoRA(r=64)微调一个 epoch
- 仓库开源(Apache-2.0/AGPL-3.0,GitHub 77.3k star),支持 GGUF、MLX、Qwen、DeepSeek、Gemma、FLUX 等
- 官方提供教程与 Notebook,可照着把任意小模型改成决策模型
「模型」频道最新
- Reza Zadeh 发帖数小时后,OpenAI 即公布 2.25 的数学新纪录 — Reza_Zadeh · 2026-10-08
- AI2 Bolmo 分词器消除全球南方文字的「token 税」 — Kyle_L_Wiggers · 2026-10-08
- Grok 机器人上线主动式功能,可主动建议你下一步做什么 — Daniel_Farinax · 2026-10-08
- OpenAI 与 Cloudflare 推出决策 API,355 道决策实测不敌 TypeSafe 的 Jev — PawelHuryn · 2026-10-08
- Gary Marcus 炮轰 OpenAI 数学突破报告:换未发布模型、零细节,过不了同行评审 — Gary Marcus · 2026-10-08
- d1-3B 小到能跑 MacBook,实测给穿搭打分 — JosephJacks_ · 2026-10-08