SetFit v1.2.0 发布:免 prompt 少样本分类器全面适配新生态
Hugging Face 的 tomaarsen 于 9 月 4 日发布 SetFit v1.2.0,这是一个免 prompt 的少样本文本分类框架:把少量标注句子构造成正负样本对,对 Sentence Transformer 做对比微调,再在嵌入上训练分类头,无需提示词或 LLM,每类仅需 8 个样本即可达到用约 3000 个样本微调 RoBERTa-Large 的效果。本次版本的核心是一次兼容性大修,使此前几乎无法在当前生态中使用的 SetFit 重新可用。
已确认
- 修复生态兼容问题:transformers v5 下无法导入、huggingfacehub v1 下无法加载 Hub 模型、Sentence Transformers v5.4+ 每次导入都告警、datasets 相关问题等,这些缺陷使 SetFit 此前明显落后于生态
- 兼容性测试矩阵覆盖 transformers 4.41–5.16、Sentence Transformers 3.0–6.0、huggingfacehub 0.24–1.30、datasets 2.15–5.x,并涉及 warmup 与日志参数在 transformers v5 下的迁移细节
- 修复导出问题:ONNX 导出在 torch 2.9+ 下恢复可用(需显式请求 legacy exporter,因新的 dynamo 默认导出器缺少所需 opsets),支持 skl2onnx 1.20,OpenVINO 支持 2026 版本
- 新增 Python 3.13 支持
- 修复 codecarbon 3.x 下训练前保存失败的问题
- 依赖调整:要求 evaluate>=0.4.6,旧版无法用 huggingfacehub v1 加载指标
- 附带文档与 notebook 更新,以及数据集 ID 命名空间等修复
- 作者补充:SetFit 自 2022 年以来一直是最便宜的可靠文本分类方案之一,无需提示词,小模型几分钟即可训练,可用 Hub 上任意 embedding 模型作骨干(示例用 ModernBERT)
为什么重要
SetFit 让没有大量标注数据或不想依赖 LLM 与提示工程的团队,仅用每类 8 个样本就能训练出有竞争力的文本分类器,且训练成本极低、支持 ONNX/OpenVINO 部署。此前版本因依赖老化几乎无法在当前生态中使用,v1.2.0 使其重新可在最新的 transformers、huggingfacehub 和 Sentence Transformers 技术栈上正常工作。
2026-09-04 ~ 2026-09-04 · 9 条相关
一手来源
- SetFit v1.2.0 发布:8 个样本训练文本分类器全面适配新生态 — tomaarsen ·
- SetFit v1.2.0 发布说明:兼容新依赖并修复 ONNX/OpenVINO 导出 — tomaarsen ·
- SetFit 修复导出:ONNX 兼容 torch 2.9+,OpenVINO 支持 2026 — tomaarsen ·
- 【源头】SetFit v1.2.0 发布:8 个样本训练文本分类器全面适配新生态 — tomaarsen · 2026-09-04
- SetFit 原理回顾:8 样本/类可匹敌 3k 样本微调的 RoBERTa-Large — tomaarsen · 2026-09-04
- SetFit 修复生态兼容:适配 transformers v5 与 huggingface_hub v1 — tomaarsen · 2026-09-04
- SetFit 适配 transformers v5:warmup 与日志参数迁移细节 — tomaarsen · 2026-09-04
- 【源头】SetFit 修复导出:ONNX 兼容 torch 2.9+,OpenVINO 支持 2026 — tomaarsen · 2026-09-04
- SetFit v1.2.0 杂项:Python 3.13、数据集 ID 命名空间等修复 — tomaarsen · 2026-09-04
- SetFit 仍是最低成本文本分类方案:小模型几分钟即可训练 — tomaarsen · 2026-09-04
- 【源头】SetFit v1.2.0 发布说明:兼容新依赖并修复 ONNX/OpenVINO 导出 — tomaarsen · 2026-09-04
另有 1 条近重复转述:tomaarsen