35B 模型智能体实测:KAT-Coder 以一半 Token 消耗追平 Qwen

IvGranite · reddit · 2026-07-28

开发者针对多款 35B 参数级别的编程模型进行了严格的智能体任务横评。测试包含 4 个模型、6 个任务、每个重复 5 次,总计 120 次运行。

结果显示,KAT-Coder-V2.5-Dev 以极低的 Token 消耗追平了表现最好的原生 Qwen3.5-35B(均通过 29/30),且工具调用格式最为规范(30 次运行零失误)。相比之下,原生 Qwen3.6 虽然分析能力最强,但存在严重的 Token 浪费和工具调用格式泄露问题;Ornith 则因频繁的格式错误和全文件重写导致成绩下滑。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →