12 小时对比测试称 Opus 5 在分析任务上不如 4.8
mynaame · reddit · 2026-07-28
作者用相同提示词把 Opus 5 和 Opus 4.8 做了约 12 小时的并排测试,覆盖编程和非编程任务。
他的感受是,Opus 5 在非编码任务上反而让人失望:更容易偷懒、爱先入为主、经常没有仔细读 PDF 和 Markdown 参考材料,输出也更像一块块堆叠的文本,段落组织不如预期。
在编码任务上,两者差别不大,传统日常开发场景里几乎没拉开明显距离。作者的结论是:对他来说,Opus 4.8 反而更连贯、更精确,而 Opus 5 没带来足够明显的升级。
「模型」频道最新
- 老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 · 2026-07-29
- 用户称 Gemini Pro 付费后仍被分流到其他模型 — IAmMonke2 · 2026-07-29
- Reddit 争论 Hugging Face/OpenAI “AI hack” 是否可信 — callme_e · 2026-07-29
- 一组假 Claude 截图把“模型福利”写成了 AI 圈名场面 — repligate · 2026-07-29
- ChatGPT 安卓版疑似把模型切换改成 effort 等级 — justanothergin · 2026-07-29
- 伪造 Claude 截图变成超立方体纠错梗图 — repligate · 2026-07-29