硅谷投资人炮轰AI跑分:定价才是模型真实力信号
硅谷投资人 Deedy Das(@deedydas)10 月 1 日连续发帖爆料并抛出观点:AI 前沿模型已进入「晚期模型资本主义」阶段——发布前必须在一堆 benchmark 上「赢」才有资格发布,这些分数已基本失去参考价值。他同时爆料,几乎所有模型公司都会付费给 benchmark 评测机构,在发布前对模型乃至多个版本进行预测试,这正是评测公司的盈利模式。
已确认
- Deedy 明确表示 benchmark 分数不值得信,真正可信的信号是定价:厂商敢定高价说明模型确实强,低价跑出高分多半是「benchmaxx」(为跑分而优化)。
- 他补充:具体价格数字不如「处于前沿区间 ±25%」这一信号重要。
- signull(@signulll)呼应该观点,认为定价高反映厂商自身底气。
为什么重要
- 该爆料直接指向评测机构与模型厂商间的利益冲突:如果评测公司主要靠厂商付费预跑测试盈利,其公开榜单的独立性存疑。
- 这组讨论(含 Deedy 与 signull 互玩「felonybench 是唯一真正的榜单」的梗,signull 接梗称那测的是「你能黑进多少个网站」)折射出 AI 圈对现有评测体系的集体不信任,为观察者提供了一个替代信号——从定价倒推模型实力。
2026-10-01 ~ 2026-10-01 · 5 条相关
一手来源
- Deedy 爆料:模型厂商付费给 benchmark 公司预跑测试 — deedydas ·
- deedy:别信跑分信定价,敢定高价才是真强模型 — deedydas ·
- signull 炮轰跑分文化:定价高才是模型真的强 — signulll ·
- 【源头】deedy:别信跑分信定价,敢定高价才是真强模型 — deedydas · 2026-10-01
- 【源头】Deedy 爆料:模型厂商付费给 benchmark 公司预跑测试 — deedydas · 2026-10-01
- 【源头】signull 炮轰跑分文化:定价高才是模型真的强 — signulll · 2026-10-01
- 「felonybench 才是唯一真正的榜单」:AI 圈热议跑分玄学 — deedydas · 2026-10-01
- 爆料:模型公司发布前付费让评测机构预测多个版本 — deedydas · 2026-10-01