8 个分类数据集实测:有标注数据时传统 ML 仍胜过 Jev 零样本
Ok_Juggernaut2187 · reddit · 2026-09-20
作者在 8 个分类数据集上,将 Jev 的零样本和少样本表现与 11 个传统 ML 模型(SVM、XGBoost、逻辑回归等)对比,评测指标为 balanced accuracy。
主要结论:
- 已有标注数据时,传统模型仍是首选:它们在 Banking77 和商业表格数据上更准确,且本地运行免去逐次调用的 API 成本
- Jev 仅在 IMDb 上表现较好,表现因任务而异
- 给 Jev 少量示例并没有带来稳定提升
- 没有看到用 Jev 替换现有可用 ML 模型的理由
实验设置:3 个训练种子 + 固定测试集 + 有限调参预算;零样本预测跨种子缓存,因此并非独立重复。完整结果与代码已开源。
「模型」频道最新
- 3 名研究员用 Claude Opus 5 接管 OpenAI 员工账户,成本仅 3000 美元 — FinanceYF5 · 2026-09-20
- 网易有道开源 Confucius4-R2T2 实时语音识别,延迟仅 200~600ms — aigclink · 2026-09-20
- 阿里开源 DAMO RADAR 医疗模型,可检测癌症等近 150 种疾病 — emmanuelvivier · 2026-09-20
- 曝 Anthropic 正内测 Claude Money,可连银行账户分析开支与订阅 — emmanuelvivier · 2026-09-20
- Mozilla 报告:开源权重模型与闭源前沿仅差约四个月 — mark_k · 2026-09-20
- 200 美元档 GPT 模型浏览来源全是无关页面,用户质疑搜索真实性 — CompetentRaindeer · 2026-09-20