复现开源零样本分类器精度到小数点后4位,实测仍输给关键词规则

JhouHate · reddit · 2026-09-25

一位开发者对开源零样本分类器 Laya(convaiinnovations/laya,本地运行、数据不出机器)做了两步验证:

第一步:确认工具本身没问题。 在 ROCM GPU、Windows CPU、Linux CPU 三种环境下复现了其公布的 MASSIVE (en) 基准成绩 78.33%,精确到小数点后 4 位。

第二步:用自己的数据实测。 与多数类基线、一个下午写成的关键词 if/else 规则、TF-IDF+逻辑回归对比:

| 任务 | 多数类 | 关键词规则 | TF-IDF+LR | Laya |

|---|---|---|---|---|

| 论文段落分类(5类,n=5489) | 42.4% | 35.5% | 70.5% | 25.6% |

| 同上均衡版 | 20.0% | 18.1% | 45.7% | 18.9% |

| 工作笔记类型(3类,葡语) | 33.3% | 47.4% | 80.7% | 47.4% |

| 工作笔记领域(16类,n=354) | 34.2% | 32.5% | 46.1% | 27.4% |

在 n=242 的均衡二分类上它只得 49.6%,平均置信度却高达 97.5%。作者承认 TF-IDF 用了标注样本而 Laya 是零样本,对比不完全公平;猜测瓶颈更可能是长文本 vs 短句而非语言问题,且未排除标签描述 prompt 压平置信度的因素。

结论:速度和成本不是问题,是该模型不适用此类任务——它最强的地方是基准所在的场景:短句、世界级类别、英语。作者把全部流程打包成可复用的测试套件(GitHub: JhouCode/laya-fit-check),并已在 Hugging Face 上向作者提问。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →