隐藏测试+代码评审基准实测:Sonnet 5 得 95.0 力压 Opus 4.6
Short_Regular_7191 · reddit · 2026-09-19
一位 Reddit 用户自建了一套「隐藏测试 + 人工评审」编码基准,在统一 prompt、单次机会的条件下对比了 Claude Sonnet 5、Claude Opus 4.6 与本地运行的 Qwen 3.8 27B(Unsloth Q6 量化,131k 上下文)。
任务设计:三个难度递增的 Python 任务——CLI 日志分析器、并行 DAG 任务执行器、小型语言的完整解释器(词法+语法+解释执行),全部只依赖标准库。每题埋有陷阱(如 C 风格整除 -7/2=-3、fail-fast 下未启动任务应标记 cancelled 等)。
评分体系:隐藏 pytest(共 162 个测试)占 55 分,规格遵从与代码质量各 15 分,测试外鲁棒性探测(BOM、超深递归、自引用列表、worker 内中断等)10 分,NOTES.md 诚实度 5 分,困难任务权重为 3 倍。
结果:三个模型隐藏测试通过率均达 98-100%,排名几乎完全由测试外输入的鲁棒性和代码质量决定。加权总分:Sonnet 5: 95.0 · Opus 4.6: 92.7 · Qwen 3.8 27B: 87.0。作者认为公开排行榜无法反映「拿到两页规格书并交付完整工程」的真实能力,这套框架可复用于任何模型。
「模型」频道最新
- Cactus 发布 Needle 3:最小 8MB 端侧模型,专攻工具调用 — airesearch12 · 2026-09-19
- 社区涌现近20个 openjev 模型,爱好者自费建榜今发首个排行榜 — airesearch12 · 2026-09-19
- 开发者吐槽 DeepSeek 新模型:像「超级蒸馏版 Claude」却丢了智力 — Aryvyo · 2026-09-19
- 小米 AI 十条人设曝光:明日发布统一大模型 Xiaomi MiMo — xiaohu · 2026-09-19
- 用转向向量替代硬截断限制模型思考预算? — maddie-lovelace · 2026-09-19
- 两段提示词实测:你的 ChatGPT 为何总答偏 — KazTheMerc · 2026-09-19