35B 模型智能体实测:KAT-Coder 以一半 Token 消耗追平 Qwen
IvGranite · reddit · 2026-07-28
开发者针对多款 35B 参数级别的编程模型进行了严格的智能体任务横评。测试包含 4 个模型、6 个任务、每个重复 5 次,总计 120 次运行。
结果显示,KAT-Coder-V2.5-Dev 以极低的 Token 消耗追平了表现最好的原生 Qwen3.5-35B(均通过 29/30),且工具调用格式最为规范(30 次运行零失误)。相比之下,原生 Qwen3.6 虽然分析能力最强,但存在严重的 Token 浪费和工具调用格式泄露问题;Ornith 则因频繁的格式错误和全文件重写导致成绩下滑。
「编程与Agent」频道最新
- Parallax 要做基于 LLM 的个人代理操作系统 — avlok · 2026-07-28
- 巧妙组合 Codex 与 Claude Code,实测节省 50% 额度 — dr_cintas · 2026-07-28
- Claude 3 Opus 自主构建迷宫世界模型 — burny_tech · 2026-07-28
- MCP Connect 主打一个协议打通智能体、工具和数据 — WirelessLife · 2026-07-28
- Claude Code 实战:让 AI 自动分析广告账户并生成复用策略 — alexgoughcooper · 2026-07-28
- Replit Agent 支持一键接入 you.com 搜索 MCP — RichardSocher · 2026-07-28