两个 2-4B 小模型实测客服任务:100 分 vs 84 分差在最后一公里

Equivalent-Grass-527 · reddit · 2026-09-16

作者用真实客服场景(查订单、查换货政策、查库存、创建换货、预约取件、回复单号)对比两个小模型,后端真实写库验证,不能靠嘴说完成。最关键的陷阱:最近仓库上海无货,需选 95 公里外的苏州;系统日期为 9 月 9 日,「明天下午」应解析为 9 月 10 日。

作者认为差异在「agency 的最后一公里」:一个在信息充分时主动完成工作流,另一个把决策推回给用户,这类缺陷在常规 benchmark 中看不出来。作者还准备了上海补货和超换货窗口两个反事实用例,并倡议以任务完成/数据库状态做端到端 agent 评测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →