Reddit 讨论:榜单赢了,也未必更适合日常使用

Alternative-Car8221 · reddit · 2026-07-26

这条帖子的核心观点是:模型在 benchmark 上赢,不代表日常使用一定更好。作者回顾了 ChatGPT 时代以来反复出现的现象——新模型一上线就“刷榜很猛”,但真正拿来做日常任务时,反而不如前一代顺手。

他把 benchmark 类比成 SAT 这类标准化考试:它们当然有比较意义,但也很容易被“专门训练去考好”而不是训练去做实际工作。作者还提到自己已经在 Opus 5 上看到类似迹象:指标上看起来更强、更省 token,但实际体验里并不总是压过旧模型或竞品。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →