SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5
HamelHusain · x · 2026-07-25
SlopCodeBench 实测:Opus 5 正与 Opus 4.8、Sonnet 5 对比
这条帖子转发的是一组正在进行中的基准测试:在 SlopCodeBench 上对比三款 Claude 模型的表现,配图里能看到实时面板和阶段结果。
- 截图时,51 个 checkpoint 已完成 8 个。
- 当前花费 $12.31,系统预估总成本约 $102。
- 面板显示在已展示的任务上,Opus 5 目前领先,严格通过数为 2/8。
- 帖子里还给出第一题的中间数据:Opus 4.8 用了 7 轮,Opus 5 用了 11 轮,Sonnet 5 已到 33 轮还在继续。
这是一个还在流式更新的评测,结论只能算阶段性观察。
「模型」频道最新
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25
- Opus 5 在 Boeing 基准上加入数值自检 — victormustar · 2026-07-25
- 转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项 — soumitrashukla9 · 2026-07-25
- Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑 — CtrlAltDwayne · 2026-07-25
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25
- Claude Opus 5 被指在 3D 编码测试上胜过 Fable 5 — rohanpaul_ai · 2026-07-25