两个 2-4B 小模型实测客服任务:100 分 vs 84 分差在最后一公里
Equivalent-Grass-527 · reddit · 2026-09-16
作者用真实客服场景(查订单、查换货政策、查库存、创建换货、预约取件、回复单号)对比两个小模型,后端真实写库验证,不能靠嘴说完成。最关键的陷阱:最近仓库上海无货,需选 95 公里外的苏州;系统日期为 9 月 9 日,「明天下午」应解析为 9 月 10 日。
- MiniCPM5-2B:完整走通全部 5 步,正确选苏州仓库并预约 2026-09-10 14:00–18:00 取件,数据库确认记录存在。100/100 分,8.35 秒,527 tokens。
- Spark-X2.5-4B:前四步全对,却在最后一步反问用户「希望什么时间段」——尽管默认时段已可用,导致换货已建但取件未约。84/100 分,12.6 秒,1460 tokens。
作者认为差异在「agency 的最后一公里」:一个在信息充分时主动完成工作流,另一个把决策推回给用户,这类缺陷在常规 benchmark 中看不出来。作者还准备了上海补货和超换货窗口两个反事实用例,并倡议以任务完成/数据库状态做端到端 agent 评测。
「编程与Agent」频道最新
- 朋友组团 vibe coding 私人聊天应用,复古老 Windows 风 UI 曝光 — floguo · 2026-09-16
- 谷歌开源 Dream-RSI:让 AI 在「做梦」中实现自我改进 — gekobraa · 2026-09-16
- 开源项目 cumora 爆火:让 agent 团队进群与人类协作 — tom_doerr · 2026-09-16
- EDSL 拟支持激活捕获与探针转向,服务 LLM 社会模拟研究 — soumitrashukla9 · 2026-09-16
- NoSpoon agent 全自动 15 分钟产出微短剧已日更数百集 — Kyrannio · 2026-09-16
- ChatGPT Astra 自主玩 Minecraft,1 小时 42 分垒出作者方块肖像 — Matt Wolfe · 2026-09-16