Opus 5 基准分更高,真实使用却明显落后 Fable
petergyang · x · 2026-07-26
- 转述的分析认为,今天常用的公开基准已经几乎无法真实区分前沿模型。
- 作者举例称,Opus 5 在真实任务里明显不如 Fable,但却在很多 benchmark 上占优,说明榜单和实际体验已经脱节。
- 因此他更信任用私有数据集做的领域评测,甚至认为未来每个团队都可能自己跑 eval,而不是依赖公共榜单。
- 贴文还暗示 Anthropic 对 5 系列 的训练方式在变化,但原帖截断,完整比较未展示。
「模型」频道最新
- GPT-5.6 Pro 找到 CP^5 反例,连破两个数学猜想 — danshipper · 2026-07-26
- Opus 5 更详细更爱建议,Kimi K3 周一开源权重 — bindureddy · 2026-07-26
- Claude Opus 5 在删掉旧工作流后明显变顺手 — thedealdirector · 2026-07-26
- Kimi 记得 PS3 密钥却漏掉最后两字节 — banteg · 2026-07-26
- Reddit 用户称 Gemini 会自己建聊天并“自问自答” — BirdAcademic848 · 2026-07-26
- Grok 4.5 扩展到工作流、Office 和千级智能体编排 — XFreeze · 2026-07-26