不用 LLM 做路由?Jev 分类器实测追平 Llama 70B
2BucChuck · reddit · 2026-09-21
一位开发者在 Reddit 分享了给自建 agent harness 挑选「模式分类器」(让本地模型在 CHAT/RESEARCH/PLAN 等模式间切换,类似 Claude Code 的做法)的实测结果。
- 背景:此前最佳分类器是 Llama 3.3 70B;新测试中 Jev 分类器与它打平。
- 关键发现:重点不在速度或准确率,而在可信的概率输出——LLM 只会给一个猜测的概率,你无法知道不确定性何时进入管线;而 Jev 标称 90% 置信时,与裁判模型 Fable 几乎 100% 一致。
- 评测方法:跑多个模型,用 Fable 打分,数据为 50% 合成 + 50% 真实日志;Claude 模型都跑在 Bedrock 上,延迟不可直接比较。
- 意外结果:Qwen Next 在原始对比中 85% 与 Fable 一致,远高于其他模型的「Fable 一致率」。
所属事件:决策模型Jev实测:路由决策约1秒,快普通LLM十倍(2 条相关)→
「编程与Agent」频道最新
- evmscope MCP 服务器上线:20 个工具覆盖 5 条 EVM 链 — modelcontextprotocol · 2026-09-21
- Latent Space 让 AI agent 对战刷 Elo 并用 x402 交易信用点 — modelcontextprotocol · 2026-09-21
- ChatGPT 联创新作 Jev:不靠长 LLM 回复做批量决策 — DrDatta_AIIMS · 2026-09-21
- Qwen3.8-Flash-Next 本地 3 小时自写自调出一个 3D 太空射击游戏 — Thin_Pollution8843 · 2026-09-21
- ττ-bench:最强 coding agent 仅过 23.9% 客户模拟 — rohanpaul_ai · 2026-09-21
- 开发者上线 Made With Jev 目录站,汇总模型演示、工具与 Skills 资源 — Sea_Supermarket_5891 · 2026-09-21