9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败

Grimmoner · reddit · 2026-09-27

一位开发者在本地 agent 环境中用 20 个真实任务(读/写/编辑/补丁各 5 个)、每个任务跑 4 种种子与思考模式,共 80 次,对比 qwen3.5:9b 与 MiMo-V2.6-Distill-Qwen-9B(IQ4XS)。成绩: incumbent 45/80 vs challenger 30/80,Fisher 精确检验 p=0.026,差距真实存在。

但比分数更有价值的是失败形态的差异:

方法论要点:作者在下结论前先逐字节核对两个 GGUF 的 chat template(含特殊 token 与 pre-tokenizer)完全一致——多数「这模型工具调用差」的说法其实是模板 bug。局限:单轮、80 次、单一量化、未测推理能力(蒸馏模型的本来用途),延迟与内存持平。

两条通用建议:把「工具调用以文本形式出现」当作独立失败类别统计,不要并入「答错」;对工具列表做断言,因为会幻觉工具名的模型终会幻觉出一个你真实存在的工具。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →