Reddit 讨论:榜单赢了,也未必更适合日常使用
Alternative-Car8221 · reddit · 2026-07-26
这条帖子的核心观点是:模型在 benchmark 上赢,不代表日常使用一定更好。作者回顾了 ChatGPT 时代以来反复出现的现象——新模型一上线就“刷榜很猛”,但真正拿来做日常任务时,反而不如前一代顺手。
他把 benchmark 类比成 SAT 这类标准化考试:它们当然有比较意义,但也很容易被“专门训练去考好”而不是训练去做实际工作。作者还提到自己已经在 Opus 5 上看到类似迹象:指标上看起来更强、更省 token,但实际体验里并不总是压过旧模型或竞品。
「模型」频道最新
- 开源模型之争正变得阵营化,信心已超过证据 — matt_slotnick · 2026-07-27
- Moonshot 为 Kimi-K3 放出 2026 年 7 月 27 日倒计时 — teortaxesTex · 2026-07-27
- Codex 被指 credits 消耗偏高,GPT-5.6 常顺序调用工具 — kevinkern · 2026-07-27
- Naval:开源权重模型的后门最终会被闭源实验室发现 — naval · 2026-07-27
- Claude Opus 5 被指更适合循环审阅式 agent 工作流 — minchoi · 2026-07-27
- Claude 10 分钟生成 38 秒电影感序列 — minchoi · 2026-07-27