SWE-Bench Pro V2 Hard 上线首日即被刷到 98%,基准再告饱和
141_1337 · reddit · 2026-09-23
Reddit 用户指出,SWE-Bench Pro V2 Hard 基准在发布首日就被顶尖模型刷到接近 98% 的完成度,几乎完全饱和。这意味着该基准已无法有效区分前沿模型的真实工程能力,凸显高难度软件工程评测基准持续失效的速度越来越快,业界需要更难、更贴近真实场景的评测方式。
所属事件:SWE-Bench Pro V2 Hard 上线首日被刷至 98%,迅速饱和(2 条相关)→
「模型」频道最新
- 一天连发四款新模型,开发者断言:模型已商品化,钱将流向硬件与应用 — xiaosun86 · 2026-09-23
- 普通用户吐槽 ChatGPT 20 美元订阅额度不够做个 PPT — Namnagort · 2026-09-23
- 开发者称 Anthropic 禁止 Claude Code 订阅用于 OpenClaw 后失去人心 — granawkins · 2026-09-23
- 开发者吐槽 API 账单失控:项目跑超后收到天价消耗账单 — daluoseo · 2026-09-23
- 用户用 Claude Opus 5.5 数分钟生成 Pitfall 风格像素动画小游戏 — technollama · 2026-09-23
- Claude Opus 5.5 写出 35.5 倍加速内核,碾压 GPT-6 Astra 纪录 — scaling01 · 2026-09-23