9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败
Grimmoner · reddit · 2026-09-27
一位开发者在本地 agent 环境中用 20 个真实任务(读/写/编辑/补丁各 5 个)、每个任务跑 4 种种子与思考模式,共 80 次,对比 qwen3.5:9b 与 MiMo-V2.6-Distill-Qwen-9B(IQ4XS)。成绩: incumbent 45/80 vs challenger 30/80,Fisher 精确检验 p=0.026,差距真实存在。
但比分数更有价值的是失败形态的差异:
- 散文式工具调用:挑战者 5 次把工具调用写成回复文本而非真正发出调用,incumbent 为 0。如果不对比解析出的 toolcalls 与回复内容,这会被误判为成功——重试逻辑不触发,人眼审查也看不出工作没执行。这是 agent 最危险的失败形态。
- 空参数补丁:20 次补丁任务中 16 次输出空输入。空参数能通过结构校验但什么都不做;incumbent 反而会产出可检测修复的畸形补丁。
- 幻觉工具:2 次调用根本不在工具列表里的 bash,属于权限边界违规,值得直接测试。
- 纯散文 derail:8 次 vs 1 次。
方法论要点:作者在下结论前先逐字节核对两个 GGUF 的 chat template(含特殊 token 与 pre-tokenizer)完全一致——多数「这模型工具调用差」的说法其实是模板 bug。局限:单轮、80 次、单一量化、未测推理能力(蒸馏模型的本来用途),延迟与内存持平。
两条通用建议:把「工具调用以文本形式出现」当作独立失败类别统计,不要并入「答错」;对工具列表做断言,因为会幻觉工具名的模型终会幻觉出一个你真实存在的工具。
「编程与Agent」频道最新
- Claude 将砍掉 plan 模式,同日 Google 才宣布上线该功能 — dotey · 2026-09-27
- Gary Marcus 转发警告:大团队用 AI Agent 或已有未知安全事故 — GaryMarcus · 2026-09-27
- 热议演讲:手写代码已不再是经济上有价值的生产活动 — AccBalanced · 2026-09-27
- 他用 Creatr 复刻 ChatGPT 界面原型,二月预测基本应验 — koltregaskes · 2026-09-27
- 开发者实测 Opus 5.5:从给 AI 打工变回 AI 给我打工 — ezshine · 2026-09-27
- AI Agent 用 TensorRT 把 Orpheus 3B 推理 RTF 从 1.03 压到 0.87 — TheMoonMidas · 2026-09-27