转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项
soumitrashukla9 · x · 2026-07-25
转发帖质疑 Claude 团队的基准图表“只突出 GPT-5.6 Sol 唯一赢的那项指标”,认为这种展示方式很不诚实。
被引用内容则是 Anthropic 的表述:Opus 5 在多项编码和知识工作评测上已成为新的 SOTA。帖子本质是在围绕模型评测结果和宣传口径争论。
「模型」频道最新
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25
- Opus 5 在 Boeing 基准上加入数值自检 — victormustar · 2026-07-25
- Opus 5 基准图曝光,编码、搜索和电脑操控全面领跑 — CtrlAltDwayne · 2026-07-25
- SlopCodeBench 实测里 Opus 5 领先 Opus 4.8 和 Sonnet 5 — HamelHusain · 2026-07-25
- 新模型实测:速度与性价比兼具的 Agent 主力 — doodlestein · 2026-07-25
- Claude Opus 5 被指在 3D 编码测试上胜过 Fable 5 — rohanpaul_ai · 2026-07-25