实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM
justinbiebar · reddit · 2026-09-22
作者用同一组 1000 条招聘广告(53 条为诈骗,全答「合法」即有 94.7% 准确率)横评五个引擎的诈骗识别能力:
- 拟合基线(12,725 条标注广告训练):accuracy 0.970 / F1 0.700 / PR-AUC 0.780,唯一可靠的是它
- deepseek-v4.1-flash(托管):0.948 / 0.329 / 0.282
- Jev(classifier.dev 免费):0.947 / 0.312 / 0.276
- GLiNER2.5-base:0.897 / 0.104 / 0.070
- 本地 Qwen2.5-1.5B(schema 约束):0.053——输出全部是合法 JSON,但把 1000 条全判为诈骗,置信度恒为 1.0
关键结论:
- 语法约束(JSON schema)不解决问题:形状从来不是难点,判断力才是;换托管模型同样代码 F1 也只有 0.329
- Jev 校准诚实(ECE 0.046)但排序能力弱:0.9 置信度下只对 8 条广告行动、抓住 53 条诈骗中的 7 条,无可用的阈值
- GLiNER2.5 不容忍合并 schema:单独问诈骗标签得分 0.998,四任务合并后排序反转(0.141/0.940),每条广告要四次前向才能修复
- 本地 1.5B 每条广告中位耗时 12.3 秒,M4 上 1000 条跑了 3249 秒;Jev 一次请求处理整批
注意事项:数据集公开且来自 2014-2018 年,两个语言模型可能见过,其成绩是上限;无标注的 LinkedIn demo 是唯一干净的测试面。
「模型」频道最新
- Paradigm 发布 Limite 1B - Violetto:专攻高频数学推理的小模型 — tensorqt · 2026-09-22
- Reliquary-4B 发布:全网矿工贡献 rollout 的去中心化 RL 训练数学代码模型 — const_reborn · 2026-09-22
- 用户尝试诱导 Jev 幻觉,宣称「骗不动」 — BLUECOW009 · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22
- OpenAI 研究员吐槽:语音模型为何还做不到真人式实时对话 — willdepue · 2026-09-22