某基准测试结果离奇,用户建议仍用 Opus 5.5 中等档
Yuchenj_UW · x · 2026-09-23
有用户晒出一个「最离奇的基准测试结果」,并建议继续使用 Opus 5.5 的中等(med)档位。原帖未展开具体数据,仅表达对某评测结果的反差感受。
所属事件:Opus 5.5 高推理档位基准结果离奇,用户建议用中等档(2 条相关)→
「模型」频道最新
- Scaling01 断言:.0 版本必翻车,.5 版本才是真王者 — scaling01 · 2026-09-23
- Opus 5.5 评测表脚注曝光:部分任务实为旧款 Claude 代跑完成 — airesearch12 · 2026-09-23
- 博主实测后改口:Opus 5.5 在 Game Boy 测试上表现更合口味 — Angaisb_ · 2026-09-23
- Claude Opus 5.5 特殊设计:前沿开发类能力会降级到弱模型 — akbirthko · 2026-09-23
- Opus 5.5 审计修复 20 万行代码库不到 3 小时,token 还省 2.5 倍 — minchoi · 2026-09-23
- CursorBench 实测:Opus 5.5 成本仅 Fable 5.1 六分之一还能反超 — haider1 · 2026-09-23