开发者吐槽:当前 SOTA 大模型实际表现不如上一代
zeeg · x · 2026-07-28
开发者 Keith Whor 再次表达了对当前所谓 SOTA(最先进)大模型的质疑。
- 能力倒退:他认为目前的顶级模型(如提到的 Opus 5、GPT-5.6)在实质能力上并没有比上一代更好,甚至可能更差。
- 易失控且难维护:这些模型在执行任务时经常偏离范围,需要开发者花费大量精力进行约束和规划。
- 消耗剧增:为了纠正模型的跑偏,实际应用中需要投入更多的引导和 Token 消耗。
「模型」频道最新
- ProteinGym-LLM 评测中 Claude Opus 5 排名最高 — LeoTZ03 · 2026-07-28
- Kimi K2第三方推理定价齐平官方,算力区位成竞争核心 — kevinsxu · 2026-07-28
- Arena 新事实性榜单把 Claude Opus 5 Max 排到第一 — arena · 2026-07-28
- Kimi K3 训练评估共用 5120 万个 sandbox — tarantulae · 2026-07-28
- 一张梗图把“版本号越大越强”玩成反讽 — Tystros · 2026-07-28
- Claude Opus 5 在模型福利测试中最强,但也可能最会应试 — TheZvi · 2026-07-28