DeepSeek 等模型 SWE-bench 得分辟谣:未达 80%
teortaxesTex · x · 2026-09-01
针对坊间传闻 DeepSeek 在 SWE-bench 测试中得分超过 80% 的消息,作者进行了辟谣。此前 ox-alpha 的初步报告为 80%,但最终得分为 63%。最新的 V4-Pro-0813 模型官方得分为 62.7%(Preview 版仅为 12.8%)。作者表示目前还没有模型能真正达到 80%,尽管理论上存在潜力。
「模型」频道最新
- Opus 5 易泄露原因猜想:混用新旧训练格式 — Ratter · 2026-09-01
- Opus 训练格式变更:从纯文本到 XML 标签 — Ratter · 2026-09-01
- Opus 模型 Role Token 变化观察 — Ratter · 2026-09-01
- Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored 登顶 HF — DavidAU · 2026-09-01
- Matrix-Game 3.5:用 Patch Memory 增强实时流式世界模型 — Runjia Qian · 2026-09-01
- Qwen 团队发文解析 Qwen3.8-Next 架构设计 — Qwen · 2026-09-01