Anthropic 的 Opus 4.8 非代码任务更强,但 5 代刷榜更好
burkov · x · 2026-07-28
作者表示,Anthropic 的 Opus 4.8 在非编程任务上比 5 代更好,自己又重新把它用于日常非代码工作。
帖子同时称,Opus 5 虽然在基准测试上赢过 Fable 5,但更像是“为了刷榜而优化”的版本:
- 基准分数更强,但
- 真实任务更笨,不如 4.8 顺手。
作者还提到,自己在编程上仍更偏好 Codex,尤其是在 Sol 最近更新之后;至于 Kimi K3,则因为感觉更慢、更贵而暂不打算尝试,并把这一点解释为中国高端 GPU 供给不足。
「模型」频道最新
- Joseph Jacks 称开放权重模型可能只落后前沿 1 到 3 个月 — JosephJacks_ · 2026-07-28
- Claude 梗图把评测写成诗,调侃 0.03 对齐分数 — maxsloef · 2026-07-28
- Gemini Flash 3.6 被称与 Sol 5.6 同质但便宜 70% — bindureddy · 2026-07-28
- Thinking Machines 发布 9750 亿参数开源多模态模型 Inkling — paraschopra · 2026-07-28
- 多人被 Opus 5 的首轮演示误导,反复任务才见真实水平 — Rasmic · 2026-07-28
- 用户称 GPT-5.4、Opus 4.6 和 Kimi k3 已够用 — haider1 · 2026-07-28