转发帖质疑 Claude 基准图只挑出 GPT-5.6 Sol 唯一赢项
soumitrashukla9 · x · 2026-07-25
转发帖质疑 Claude 团队的基准图表“只突出 GPT-5.6 Sol 唯一赢的那项指标”,认为这种展示方式很不诚实。
被引用内容则是 Anthropic 的表述:Opus 5 在多项编码和知识工作评测上已成为新的 SOTA。帖子本质是在围绕模型评测结果和宣传口径争论。
「模型」频道最新
- giffmana 补充:环境用于训练正是他要说的重点 — giffmana · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11
- RoMa v2 图像匹配模型发布,作者晒出黑底宣传图 — ducha_aiki · 2026-09-11
- OpenAI 称 Astra 达 Critical 网络安全阈值,且比上代更难监控 — theguywhobuilds · 2026-09-11