自建基准:35B 的 Qwen3.6 得 95%,完胜 120B 的 GPT-OSS 53%

pauliusztin · reddit · 2026-09-26

一位从零构建 AI agent 的开发者分享:在自己的编码 agent 基准上,Qwen3.6-35B 拿到 95% pass@1,而体量约四倍的 GPT-OSS-120B 只有 53%——通用榜单和参数规模不可信,必须为自家用例建评测。

基准设计要点

关键提醒:评测 harness 是针对 Qwen3.6-35B 调优的,这正是分差巨大的原因——针对模型优化 harness 的重要性不亚于模型本身的规格。

成本对比:同一模型同一负载,按 token 付费(OpenRouter)约 $0.18/1.2M tokens,比按 GPU 小时付费(Modal)更便宜;GPU 方案只有在能批量跑满任务时才划算。

作者结论:模型大小与榜单排名参考价值有限,不测自己的用例就无法信任通用报告。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →