Zeeg 质疑"智能大降价"叙事:基准提升 10% 用户根本无感
zeeg · x · 2026-10-08
- Zeeg 指出早期基准测试的通病:展示的 10% 提升对普通用户来说几乎察觉不到。
- 他以 Luna 为正面例子:这类模型同时在价格和智能上都更好,才具备真实可比性,背后有大量真实任务验证。
- 在被引用的原推中,他建议做一个练习:找三年前模型能高准确率完成的任务,按今天的价格算成本,再对各种任务谱系重复这个 exercise——结论是我们并没有得到"便宜了几个数量级的智能"。
- 老模型仍能干很多活,但运行成本并没有显著下降;顶尖智能水平在提升,同时很多任务的成本并未同步降低。
所属事件:theo 与 Sentry CEO 激辩:AI 智能到底变便宜了多少(9 条相关)→
「模型」频道最新
- 微软 Windows 发布会展示 GitHub Copilot 支持本地 AI 运行 — film_girl · 2026-10-08
- Aleph Alpha 开源德语模型 Kolibri:78B 参数每词仅激活 3B — lmoroney · 2026-10-08
- ChatGPT 更新翻车?用户晒报错截图劝大家去摸草 — TheMoonMidas · 2026-10-08
- 4700 会话实测 Jev Router:成本高 38%,可操控性接近 Opus 5.5 — arena · 2026-10-08
- Claude Haiku 5.5 登陆 Databricks:质升 15%、成本更低 — matei_zaharia · 2026-10-08
- Perplexity CEO 晒 Decider 决策模型速通《百万富翁》演示 — AravSrinivas · 2026-10-08