Qwen 3.8 27B 登顶 SlopCodeBench:严苛得分仅 17.6%
corruptbytes · reddit · 2026-08-20
在 HumanLayer 的 SlopCodeBench 评测中,Qwen 3.8 27B 在 Opus 子集(17 检查点)的严格得分仅为 17.6%,低于 DeepSeek V4 Flash 和 Claude Code。报告指出其在严格检查点表现较差,不适合独立管理代码库,但在核心检查点表现尚可。
「模型」频道最新
- ChatGPT宕机:OpenAI已定位并监控恢复 — ns123abc · 2026-08-20
- ChatGPT宕机:登录和注册全部中断 — ns123abc · 2026-08-20
- 模型已能在 1 小时内写出复杂软件 — BLUECOW009 · 2026-08-20
- Qwen3.8 与 Gemma4 等多模型本地部署量化横评预告 — karminski3 · 2026-08-20
- Claude Code 遭遇水逆,替代品评测出炉 — Hesamation · 2026-08-20
- 实战:用 Ling 3.0 Tiny 做 Qwen Agent 的加速辅助 — My_Unbiased_Opinion · 2026-08-20