置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍
AgitatedUsual8995 · reddit · 2026-10-09
作者在 900 条真实消费者投诉、路由到 9 个团队的任务上对比了 Nimble 9B 与其基座模型 Qwen 3.5-9B。
- 整体准确率接近:Nimble 77.1% vs Qwen 76.3%
- 延迟几乎相同:同一硬件 8-bit 下约 2.25s vs 2.07s
- 关键差异在高置信自动化:以 95% 准确率为阈值,Nimble 可自动处理 43% 流量,Qwen 仅 16%
结论:在决策路由类生产场景中,模型整体准确率相近时,置信度校准质量决定了可自动化比例,Nimble 因此达到基座的 2.7 倍效率。作者附上了完整评测方法与配置。
「模型」频道最新
- Emad Mostaque:OpenAI 解 Navier-Stokes 花掉千万美元算力 — rohanpaul_ai · 2026-10-09
- 马斯克站台 Grok Bot:可调用 Opus 5.5、全量访问 X 数据 — elonmusk · 2026-10-09
- 开发者吐槽 Opus 5.5 不打招呼就塞进一堆小修复 — rickasaurus · 2026-10-09
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09