本地 Qwen 编码模型实测追平 Claude Opus 4.6,同分 92.7

Short_Regular_7191 · reddit · 2026-10-04

作者用 3 个 Python 任务(日志分析器、并行任务运行器、玩具语言解释器)对比两款本地模型与 Claude Opus 4.6,各一次尝试,用 162 个隐藏测试加固定清单代码评审打分,硬任务计 3 倍权重。

结果(满分 100):

简单任务两个本地模型都赢 Opus(97/92 vs 88),中等任务 Opus 胜,难题 Opus 与 Coder 同为 92。定性差异:Opus 代码更干净易维护,本地 Coder 在异常输入上更少崩溃。

本地配置:i5-14400、48GB 内存、双 RTX 5060 Ti 共 32GB 显存;27B Q6 稳定 50 tokens/s,Coder 平均 60–65 tokens/s。

作者承认局限:每模型只跑一次、2-3 分差距无意义、评审部分由 AI(Claude Fable 5.1)完成但评分表公开、任务规模小不代表大型真实项目表现。结论是:在这个规模的任务上结果已分不出差别,对省钱很有意义。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →