Opus 5 分数很高, 但实际用起来仍偏飘
brandon_galang · x · 2026-07-29
作者表示,Opus 5 并不是坏模型,但它在排行榜上的高分并没有转化成“用起来明显更好”的直观体验。
他的核心判断是:如果任务不是一次性 one-shot 就能完成,模型的行为手感 / ergonomics 很重要。相比之下,Fable 5 刚上手时就显得更直接、更明显地好用;而 Opus 5 则更“飘”、更难把握。
这条帖子的重点不是否定模型能力,而是强调基准分数和真实使用体验之间可能存在落差。
所属事件:Opus 5跑分虽高但实际体验被指不如预期(4 条相关)→
「模型」频道最新
- Together AI 联合 Moonshot 举办 Kimi K3 架构分享 — togethercompute · 2026-07-29
- 三个前沿模型把简单抽链任务写成了网页应用 — NickPassig · 2026-07-29
- Fable 被赞会优先尝试并行与多流方案 — dejavucoder · 2026-07-29
- Kimi K3 开头信息密度很高,少量 token 装下很多内容 — nathanbenaich · 2026-07-29
- MoonshotAI 的 FlashKDA 提交暗示主线模型用了混合注意力 — peterjliu · 2026-07-29
- 用户称 Opus 5 会忽略工具并破坏工作流 — omarsar0 · 2026-07-29