Qwen 3.8 27B 登顶 SlopCodeBench:严苛得分仅 17.6%

corruptbytes · reddit · 2026-08-20

在 HumanLayer 的 SlopCodeBench 评测中,Qwen 3.8 27B 在 Opus 子集(17 检查点)的严格得分仅为 17.6%,低于 DeepSeek V4 Flash 和 Claude Code。报告指出其在严格检查点表现较差,不适合独立管理代码库,但在核心检查点表现尚可。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →