Anthropic 的 Opus 5 跑分赢了,私有评测却说法不同
FinanceYF5 · x · 2026-07-28
Opus 5 被认为跑分赢了,但私有评测更重要
这条帖子结合配图在讨论 Anthropic 的 Opus 5。作者的核心观点是:虽然 Opus 5 在不少公开基准上打赢了 Fable,但真实使用体验并不在同一量级,所以“跑分赢”已经不足以说明问题。
帖中强调了三点:
- 公开基准越来越不可信,作者现在更看重自己构建的私有领域数据集评测;
- Anthropic 似乎在 5 系列里尝试了新的训练方式;
- 模型协作体验整体在变差:过去 Claude 的优势是“好用、顺手”,现在作者反而更喜欢 Grok,Kimi 也不错。
图片里的另一层意思是,Anthropic 和 OpenAI 似乎都在把重心从 RLHF 转向更容易规模化、可机器验证的强化学习。
所属事件:Anthropic Opus 5 基准领先但实战口碑分裂(6 条相关)→
「Fun」频道最新
- 「革命将受 token 上限约束」:一句梗道尽上下文窗口之苦 — AIandDesign · 2026-09-11
- 从业者共鸣:怀念应用的人工手艺、人类写作与技术争论 — vboykis · 2026-09-11
- 「见到卖课大师就霸凌到他退网」:伪禅宗语录讽刺 X 卖课潮 — DionysianAgent · 2026-09-11
- antirez 吐槽:封面放震惊脸的 YouTube 视频一律不看 — antirez · 2026-09-11
- 无CGI哈利·波特画面生成翻车,被讽对齐团队尽职尽责 — gaganghotra_ · 2026-09-11
- AI 圈名言:我以前是梗图号,现在为社会未来负责了 — PeterBowdenLive · 2026-09-11