隐藏测试+代码评审基准实测:Sonnet 5 得 95.0 力压 Opus 4.6

Short_Regular_7191 · reddit · 2026-09-19

一位 Reddit 用户自建了一套「隐藏测试 + 人工评审」编码基准,在统一 prompt、单次机会的条件下对比了 Claude Sonnet 5、Claude Opus 4.6 与本地运行的 Qwen 3.8 27B(Unsloth Q6 量化,131k 上下文)。

任务设计:三个难度递增的 Python 任务——CLI 日志分析器、并行 DAG 任务执行器、小型语言的完整解释器(词法+语法+解释执行),全部只依赖标准库。每题埋有陷阱(如 C 风格整除 -7/2=-3、fail-fast 下未启动任务应标记 cancelled 等)。

评分体系:隐藏 pytest(共 162 个测试)占 55 分,规格遵从与代码质量各 15 分,测试外鲁棒性探测(BOM、超深递归、自引用列表、worker 内中断等)10 分,NOTES.md 诚实度 5 分,困难任务权重为 3 倍。

结果:三个模型隐藏测试通过率均达 98-100%,排名几乎完全由测试外输入的鲁棒性和代码质量决定。加权总分:Sonnet 5: 95.0 · Opus 4.6: 92.7 · Qwen 3.8 27B: 87.0。作者认为公开排行榜无法反映「拿到两页规格书并交付完整工程」的真实能力,这套框架可复用于任何模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →