Anthropic 的 Opus 5 跑分赢了,私有评测却说法不同
FinanceYF5 · x · 2026-07-28
Opus 5 被认为跑分赢了,但私有评测更重要
这条帖子结合配图在讨论 Anthropic 的 Opus 5。作者的核心观点是:虽然 Opus 5 在不少公开基准上打赢了 Fable,但真实使用体验并不在同一量级,所以“跑分赢”已经不足以说明问题。
帖中强调了三点:
- 公开基准越来越不可信,作者现在更看重自己构建的私有领域数据集评测;
- Anthropic 似乎在 5 系列里尝试了新的训练方式;
- 模型协作体验整体在变差:过去 Claude 的优势是“好用、顺手”,现在作者反而更喜欢 Grok,Kimi 也不错。
图片里的另一层意思是,Anthropic 和 OpenAI 似乎都在把重心从 RLHF 转向更容易规模化、可机器验证的强化学习。
所属事件:Anthropic Opus 5 跑分虽高但实际体验引争议(2 条相关)→
「Fun」频道最新
- 国民焦糖布蕾日 AI 挑战作品展示串上线 — LudovicCreator · 2026-07-28
- 游戏角色牵狗出镜,成了一个可爱的多模态混搭视频 — Humble-Tangerine-878 · 2026-07-28
- 用户称 Opus 5 让 17 次月导出变得多余 — gaganghotra_ · 2026-07-28
- 一条 AI 做出的《海贼王》真人版,被说成粉丝真正想要的版本 — eyishazyer · 2026-07-28
- 马斯克称会向善意 AI 公司供算力,必要时可收回 — XFreeze · 2026-07-28
- 小狗面对 Google OmniFlash 意外很淡定 — jnack · 2026-07-28