用户反馈 Opus 5 更易翻车,Opus 4.8 仍然更稳
omarsar0 · x · 2026-07-28
这条回复是在直接评价 Anthropic 几个模型的使用体感:
- Opus 5 被形容得很“ignorant”,而且经常把事情做坏。
- Opus 4.8 目前在这位用户手里仍然表现很好。
- 做出“fantastic results”的工具则是 Fable。
它不是泛泛吐槽,而是很具体的模型稳定性反馈,重点在于“谁更容易翻车、谁更稳”。
所属事件:Claude Opus 5 实测:单 prompt 生成惊艳,长程任务仍逊于 Fable(24 条相关)→
「模型」频道最新
- Fireworks 测试 Kimi K3:663 个编码任务里质量接近 Opus 5 — lqiao · 2026-07-28
- 传闻称 Anthropic 有更大的内部教师模型,公开版也接近 K3 — teortaxesTex · 2026-07-28
- Kimi 报告披露覆盖编程与 Agent 的内部评测体系 — stochasticchasm · 2026-07-28
- Claude 仍被称为最可控的模型集,尽管它很怪 — sloppenheimer · 2026-07-28
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28
- Kimi K3 Max 登顶 Arena 榜首,前端与 Agent 任务全面领先 — arena · 2026-07-28