复现开源零样本分类器精度到小数点后4位,实测仍输给关键词规则
JhouHate · reddit · 2026-09-25
一位开发者对开源零样本分类器 Laya(convaiinnovations/laya,本地运行、数据不出机器)做了两步验证:
第一步:确认工具本身没问题。 在 ROCM GPU、Windows CPU、Linux CPU 三种环境下复现了其公布的 MASSIVE (en) 基准成绩 78.33%,精确到小数点后 4 位。
第二步:用自己的数据实测。 与多数类基线、一个下午写成的关键词 if/else 规则、TF-IDF+逻辑回归对比:
| 任务 | 多数类 | 关键词规则 | TF-IDF+LR | Laya |
|---|---|---|---|---|
| 论文段落分类(5类,n=5489) | 42.4% | 35.5% | 70.5% | 25.6% |
| 同上均衡版 | 20.0% | 18.1% | 45.7% | 18.9% |
| 工作笔记类型(3类,葡语) | 33.3% | 47.4% | 80.7% | 47.4% |
| 工作笔记领域(16类,n=354) | 34.2% | 32.5% | 46.1% | 27.4% |
在 n=242 的均衡二分类上它只得 49.6%,平均置信度却高达 97.5%。作者承认 TF-IDF 用了标注样本而 Laya 是零样本,对比不完全公平;猜测瓶颈更可能是长文本 vs 短句而非语言问题,且未排除标签描述 prompt 压平置信度的因素。
结论:速度和成本不是问题,是该模型不适用此类任务——它最强的地方是基准所在的场景:短句、世界级类别、英语。作者把全部流程打包成可复用的测试套件(GitHub: JhouCode/laya-fit-check),并已在 Hugging Face 上向作者提问。
「研究」频道最新
- 诺基亚开源 AnyJev:免训练把任意 LLM 变成校准决策模型 — kalyan_kpl · 2026-09-25
- 拆解 Philox:PyTorch 如何在 GPU 上并行生成随机数 — abhi9u · 2026-09-25
- 独立研究者 11 组实验指激活转向测量几何有误,提出 AkbasCore 3.2 — Nearby_Indication474 · 2026-09-25
- 学者撰文解析 2026 年 tenure-track 教职求职生存现状 — mboehme_ · 2026-09-25
- Grady Booch 反驳"LLM 收敛出类脑结构":差距仍如鸿沟 — Grady_Booch · 2026-09-25
- ICLR 2027 再爆投稿去匿名化,OpenReview 发布声明 — Striking-Warning9533 · 2026-09-25