4B 模型微调实战:Qwen3 蒸馏 72B 老师,分类准确率 72%→91%
Dangerous-Nerve-7766 · reddit · 2026-08-21
作者通过实验回答:在狭窄重复任务上,微调后的 4B 模型能多接近 72B 模型?任务为工单分类(6 标签)和发票提取(嵌套 JSON)。使用 Qwen2.5-72B-Instruct 生成合成数据作为 Teacher,在 Qwen3-4B 上进行 QLoRA 微调。
结果:
- 工单分类:Zero-shot 72.4% → 90.8% (Macro-F1 0.90)。
- 发票字段匹配:82.9% → 93.5%。
- 发票全字段正确行:1.2% → 62.5% (Zero-shot 几乎总是违反 Null 约定)。
关键发现:Zero-shot 基线在发票提取上极差(1.2%全对),因为它系统性地违反了 Schema 的 Null 约定(如自行计算 subtotal 等于 total)。微调不仅提升了准确率,更重要的是学会了严格遵守 Schema 约定。成本在租用 4090 上每轮不到 2 美元。
「研究」频道最新
- NVIDIA 与 UC Berkeley 开源触觉机器人方法论 T-Rex — DrJimFan · 2026-08-22
- Lightwheel 开源 10 万小时人手操作数据集 — vanstriendaniel · 2026-08-22
- 可视化工具 Bonsai 发布:替代 t-SNE/UMAP — anshulkundaje · 2026-08-22
- 「AI 审稿第一步看技术对错」:论文评价标准该重排了 — Afinetheorem · 2026-08-21
- 纯 C 写的 TRiP 框架:支持多模型训练与推理 — RelevantShape3963 · 2026-08-21
- 单段广播画面恢复厘米级球路:板球追踪逼近 Hawkeye — richdotca · 2026-08-21