Qwen 35B-A3B 变体模型 Tool Calling 能力横评

OsmanthusBloom · reddit · 2026-08-26

作者对 Qwen3.6-35B-A3B 及其微调版本进行了工具调用能力评测。在 32GB V100 集群上,使用 tool-eval-bench 2.6.0 进行了 88 项测试(Hardmode)。结果显示,Ornith 1.5 和基于它的 Tiel-Coder 表现最佳,分数接近 Qwen3.8-27B,且显著优于 Qwen3.6-27B。KAT Coder 也略胜于原版 35B-A3B。测试使用了 llama.cpp,针对 Q4 量化版本进行了多轮运行,并控制了上下文压力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →