SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5
HamelHusain · x · 2026-07-25
SlopCodeBench 实测:Opus 5 正与 Opus 4.8、Sonnet 5 对比
这条帖子转发的是一组正在进行中的基准测试:在 SlopCodeBench 上对比三款 Claude 模型的表现,配图里能看到实时面板和阶段结果。
- 截图时,51 个 checkpoint 已完成 8 个。
- 当前花费 $12.31,系统预估总成本约 $102。
- 面板显示在已展示的任务上,Opus 5 目前领先,严格通过数为 2/8。
- 帖子里还给出第一题的中间数据:Opus 4.8 用了 7 轮,Opus 5 用了 11 轮,Sonnet 5 已到 33 轮还在继续。
这是一个还在流式更新的评测,结论只能算阶段性观察。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11