本地 Qwen 编码模型实测追平 Claude Opus 4.6,同分 92.7
Short_Regular_7191 · reddit · 2026-10-04
作者用 3 个 Python 任务(日志分析器、并行任务运行器、玩具语言解释器)对比两款本地模型与 Claude Opus 4.6,各一次尝试,用 162 个隐藏测试加固定清单代码评审打分,硬任务计 3 倍权重。
结果(满分 100):
- Claude Opus 4.6:92.7(隐藏测试 162/162 全过)
- Qwen3.8-Flash-Next "Coder"(本地,Strata 剪枝版,IQ1M GGUF):92.7(161/162)
- Qwen 3.8 27B Unsloth Q6:87.0(160/162)
简单任务两个本地模型都赢 Opus(97/92 vs 88),中等任务 Opus 胜,难题 Opus 与 Coder 同为 92。定性差异:Opus 代码更干净易维护,本地 Coder 在异常输入上更少崩溃。
本地配置:i5-14400、48GB 内存、双 RTX 5060 Ti 共 32GB 显存;27B Q6 稳定 50 tokens/s,Coder 平均 60–65 tokens/s。
作者承认局限:每模型只跑一次、2-3 分差距无意义、评审部分由 AI(Claude Fable 5.1)完成但评分表公开、任务规模小不代表大型真实项目表现。结论是:在这个规模的任务上结果已分不出差别,对省钱很有意义。
「模型」频道最新
- RL 环境本质是数据:未饱和时推进前沿,饱和后失效 — Shahules786 · 2026-10-04
- GLM 驱动国际象棋机器人 AI 逆转绝杀人类对手 — MikePFrank · 2026-10-04
- 网友称 mythos 5 是最有魅力的语言模型之一 — repligate · 2026-10-04
- Apodex 1.1 Mini 上线 Novita AI,免费试用延长至 14 天 — SimonShaoleiDu · 2026-10-04
- Cloudflare 在 HF 发布视觉模型 clef,作者喊话 Perplexity 接入 — ostrisai · 2026-10-04
- Reddit 用户实测:Codex 一周耗尽额度,Claude 仅用 2% — Peleias · 2026-10-04