Opus 5 基准测试近乎完美,真实体验却很不稳定
yunta_tsai · x · 2026-07-28
有人吐槽 Opus 5 的体验“非常分裂”:
- 基准测试几乎完美,但
- 真实使用却很看运气,结果并不稳定。
发帖者因此怀疑,当前 benchmarking 可能已经碰到 信噪比上限,分数越来越难准确反映实际体验。
「模型」频道最新
- Moonshot 发布 Kimi K3:2.8T MoE 和 100 万上下文 — burny_tech · 2026-07-28
- Thinking Machines 发布 9750 亿参数开源多模态模型 Inkling — paraschopra · 2026-07-28
- 多人被 Opus 5 的首轮演示误导,反复任务才见真实水平 — Rasmic · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28
- LLaDA2.2 让扩散语言模型首次进入长程 Agent 任务 — 量子位 · 2026-07-28
- ChatGPT 与 Gemini 的丑闻覆盖差异引发对比 — Partygoer69420 · 2026-07-28