多次实测后,用户称 Opus 5 省 token 但推理更浅
Physical_Concert_625 · reddit · 2026-07-25
作者称自己连续测试 Opus 5 一天后,感觉外界对它的评价被严重夸大了。
- 他承认这模型 确实更省 token,但代价是:思考更浅、决策更差、推理不够深入。
- 在他看来,Opus 5 的实际表现 远达不到 外界拿来和其他 LLM 对比时所宣称的水平。
- 帖子最后是在征集其他人的上手体验,看看这种观感是不是普遍存在。
所属事件:Claude Opus 5 早期实测:编码强但破坏旧工作流(14 条相关)→
「模型」频道最新
- Opus 5 被拿来对标 GPT-4o 时刻,而不只是刷分升级 — yawnxyz · 2026-07-25
- Epoch 图表显示 GPT-5.6 Sol 领跑两项 ECI,GPT-6 被指 8 月登场 — iruletheworldmo · 2026-07-25
- GPT-5.6 Sol 在 5 个测试里更便宜,Agent 成本差会变成利润 — PrajwalTomar_ · 2026-07-25
- Claude Opus 5 在 max effort 下明显强于 Opus 4.8 — legit_api · 2026-07-25
- CNBC:蒸馏之争变成了谁能从谁训练模型 — shashib · 2026-07-25
- Kimi K3 带动开源模型继续升温,前沿实验室密集发新 — demian_ai · 2026-07-25