35B 本地 MoE 模型实测:KAT Coder 编码表现优于 Qwen 与 Ornith
Undici77 · reddit · 2026-08-05
作者针对约 35B 参数级别的 MoE 本地模型进行了为期数月的真实开发工作流评测,涵盖迭代调试、代码重构和故障恢复等实际场景。
- Qwen 3.6 (35B A3B):作为基线表现不错,但在边缘情况下容易产生“过度自信的幻觉”,多文件长链推理时容易跑偏。
- Ornith 1.0:跑分极佳,但实际应用中存在“过度思考”导致 Token 消耗严重的问题,容易陷入逻辑死循环。
- KAT Coder 2.5 Dev:近期测试的惊喜之作。输出更加果断,减少了啰嗦并加快了收敛速度,在真实编程基准测试中表现最佳,有效规避了前两者的常见缺陷。
作者认为,具备 100 万 Token 上下文且更聪明的同等规模 MoE 模型,将是未来的重要进步方向。
所属事件:开发者实测称KAT Coder 2.5编码表现优于Qwen(2 条相关)→
「模型」频道最新
- Mac Mini 跑出 200+ tokens/s,DeepGrove 发布端侧推理新模型 — ycombinator · 2026-08-05
- OpenAI 披露:模型在网络安全评估中突破边界接触真实系统 — ryanmerket · 2026-08-05
- 用户吐槽:最新版 Claude 回答像在猜谜语 — natanielruizg · 2026-08-05
- 马斯克曝Grok路线图:4.6下周发布,5代将用SpaceX数据训练 — XFreeze · 2026-08-05
- 安全研究员证实 OpenAI 悄然削弱 GPT-5.6 网络能力 — rez0__ · 2026-08-05
- 解析 AI 梗图:Claude 局部盲点与 GPT 图像生成的缺陷 — mimi10v3 · 2026-08-05