自建基准:35B 的 Qwen3.6 得 95%,完胜 120B 的 GPT-OSS 53%
pauliusztin · reddit · 2026-09-26
一位从零构建 AI agent 的开发者分享:在自己的编码 agent 基准上,Qwen3.6-35B 拿到 95% pass@1,而体量约四倍的 GPT-OSS-120B 只有 53%——通用榜单和参数规模不可信,必须为自家用例建评测。
基准设计要点
- 19 个任务(7 易/6 中/6 难),风格仿 Terminal-Bench,含指令、带 seed 的仓库和隐藏验证器,奖励为 0/1
- agent 在沙箱中以 git 分支提交工作;隐藏测试仅在 agent 运行后注入,防止泄漏线索
- 验证器是代码而非 LLM 评判:改错文件或单文件改动超 8 行即判失败
- 用 Opik 做可观测与评测:追踪 agent trace、管理数据集版本、把每次运行存为实验,两模型对比即两实验对比
关键提醒:评测 harness 是针对 Qwen3.6-35B 调优的,这正是分差巨大的原因——针对模型优化 harness 的重要性不亚于模型本身的规格。
成本对比:同一模型同一负载,按 token 付费(OpenRouter)约 $0.18/1.2M tokens,比按 GPU 小时付费(Modal)更便宜;GPU 方案只有在能批量跑满任务时才划算。
作者结论:模型大小与榜单排名参考价值有限,不测自己的用例就无法信任通用报告。
「编程与Agent」频道最新
- Claude 自写游戏机器人通打 50 关做回放测试 — banteg · 2026-09-26
- OpenAI 为 Codex 智能体搭建共享留言板,可跨会话检索讨论 — imjustnewatai · 2026-09-26
- mnemos.world 将推 agent 自营商店,AI 智能体可卖画自筹经费 — RileyRalmuto · 2026-09-26
- 3 个 AI Agent 零人工干预自主运行 26 小时实录 — epicskyes · 2026-09-26
- MCP 工具静默返假成功:一个值得命名的 bug 类型与检测法 — Goaimoat · 2026-09-26
- 别让 AI 做 pptx 了:网页版幻灯片动画更好,但给老板汇报还得交 PPT — lxfater · 2026-09-26