35B 模型智能体实测:KAT-Coder 以一半 Token 消耗追平 Qwen
IvGranite · reddit · 2026-07-28
开发者针对多款 35B 参数级别的编程模型进行了严格的智能体任务横评。测试包含 4 个模型、6 个任务、每个重复 5 次,总计 120 次运行。
结果显示,KAT-Coder-V2.5-Dev 以极低的 Token 消耗追平了表现最好的原生 Qwen3.5-35B(均通过 29/30),且工具调用格式最为规范(30 次运行零失误)。相比之下,原生 Qwen3.6 虽然分析能力最强,但存在严重的 Token 浪费和工具调用格式泄露问题;Ornith 则因频繁的格式错误和全文件重写导致成绩下滑。
「编程与Agent」频道最新
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- Massive 联手 Coinbase,AI Agent 可付费获取实时市场数据 — kleffew94 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23