实测 5 个 Qwen3.6-35B 微调版:几乎全被原版基座碾压
returnity · reddit · 2026-09-29
Reddit 用户 returnity 用 Aider Polyglot 基准(约 10 小时本地跑完)对比了 Qwen3.6-35B-A3B 基座与 5 个微调版:Occamy-1.0、Ornith-1.5、KAT-Coder-V2.5-Dev、Tiel-Coder、Nex-N2.5-mini。
核心结论:基座几乎全面领先,微调爱好者可能失望。
- 基座首次通过率 37.4%、重试通过率 71.0%,格式良好的 diff 达 96.3%
- 唯一能竞争的是 Occamy-1.0(30.8% 首过、69.2% 重试),且 token 用量更省
- KAT-Coder 准确率较低(20.6%)但极快极省 token,适合当 subagent
- 社区热门的 Tiel-Coder 表现糟糕(18.7%),其「terse mode」大幅降低准确率;作者建议想减少冗长应调低 reasoning effort(xhigh→medium 可省约 1/3 token 而准确率基本不变)
- Nex-N2.5-mini 最差,首过仅 10.3%、每题 33.3K token
模板对比显示 stock 与 froggeric 模板对分数影响很小。
「模型」频道最新
- Sonnet 5.5 被指刷榜:成绩亮眼但成本与 token 效率反超上代 — haider1 · 2026-09-29
- Reddit 网友:OpenAI 模型对齐远逊 Anthropic,Astra 延迟或因行为问题 — ErmingSoHard · 2026-09-29
- 日本主权 LLM 项目 LLM-jp 发布 4.1 系列,新增工具调用能力 — markjeffrey · 2026-09-29
- Anthropic Opus 5.5 发布令开发者焦虑:OpenAI DevDay 必须给出回应 — imjustnewatai · 2026-09-29
- OpenAI DevDay 或无新前沿模型,网友威胁退订 5x Pro — PrisonOfH0pe · 2026-09-29
- Claude Code Projects 默认低 effort,Anthropic 工程师爆料 Sonnet 5.5 已加入 — lydiahallie · 2026-09-29