Qwen 35B-A3B 变体模型 Tool Calling 能力横评
OsmanthusBloom · reddit · 2026-08-26
作者对 Qwen3.6-35B-A3B 及其微调版本进行了工具调用能力评测。在 32GB V100 集群上,使用 tool-eval-bench 2.6.0 进行了 88 项测试(Hardmode)。结果显示,Ornith 1.5 和基于它的 Tiel-Coder 表现最佳,分数接近 Qwen3.8-27B,且显著优于 Qwen3.6-27B。KAT Coder 也略胜于原版 35B-A3B。测试使用了 llama.cpp,针对 Q4 量化版本进行了多轮运行,并控制了上下文压力。
「模型」频道最新
- IBM 发布 Granite 4.2 模型,专注企业 Agent 工作流 — realmrfakename · 2026-08-26
- 曝 OpenAI 完成超 10T 参数预训练 Bel,Anthropic 因算力短板恐全年被动 — rohanpaul_ai · 2026-08-26
- Together 推荐榜单:Kimi K3、DeepSeek V4 分场景夺冠 — togethercompute · 2026-08-26
- Astra 两月未支持多模型?网友质疑宣传 — teortaxesTex · 2026-08-26
- 观点:模型发展至今,推理速度比模型大小更重要 — natesiggard · 2026-08-26
- Tiel-Coder-35B 模型:本地推理速度达 121.4 tok/s — DerTomsn · 2026-08-26