开发者吐槽 Claude 3.5 Opus:疑似专为跑分优化,实测变蠢

evilsocket · x · 2026-07-31

知名开发者 evilsocket 在社交平台表达了对 Claude 3.5 Opus 模型的强烈不满。他抱怨称,在日常的实际开发与测试中,该模型的表现感觉比此代的 4.8 版本(注:可能指代 GPT-4.8 或其他竞品)要笨拙得多。

他怀疑 Anthropic 在训练该模型时过度进行了“跑分优化”(benchmaxxed),导致模型在公开的基准测试中分数很高,但在真实的复杂工作流中却难以胜任。

所属事件:Claude Opus 系列被指体验下滑:偷懒失忆引信任危机(14 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →