299 条真实意图实测:分类器路由比 GLM-4-Flash 慢 6.5 倍但稳
Sufficient_Flower860 · reddit · 2026-09-23
作者在自研飞书生活助手路由器上,用同一套金标和 19 个技能的难题集,对 299 条真实用户意图做了生产级对比:
- glm-4-flash(生成式,生产在用):271/299 = 90.6%
- TypeSafe Jev(分类器/System One):262/299 = 87.6%
关键差异在失败模式:GLM 独占的 29 个 case 里 23 个是模糊技能归属(trip-planner vs life-service),而 Jev 独占的 20 个里 15 个是 GLM 的 JSON/解析失败导致生产回退到 unknown。
性能与成本:Jev p50 0.55s vs GLM 3.6s;格式解析失败 0 vs 16;299×2 次调用仅花 $0.086。
结论:作者仍会把分类器放在关键路径第一道,但 Jev 只做路由、不抽参数,生产链路仍需在门控后接一个生成式步骤。测试用自家 llm-fit 工具跑在生产意图路径上,非公开榜单。
「编程与Agent」频道最新
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- 警惕「提示词债务」:自然语言不是可靠的系统规格语言 — dbreunig · 2026-09-23
- Coinbase for Agents 上线股票交易,支持 6000+ 只美股 — kleffew94 · 2026-09-23
- Massive 联手 Coinbase,AI Agent 可付费获取实时市场数据 — kleffew94 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23