signull 炮轰跑分文化:定价高才是模型真的强
signulll · x · 2026-10-01
Deedy 感叹前沿模型发布前必须刷赢一堆 benchmark,这些数字毫无意义。signull 回应:真正该信的是价格——定价高说明厂商自己有底气,低价跑高分多半是「benchmaxx(为跑分而优化)」。随后 Deedy 玩梗称「felonybench 才是唯一真正的榜单」,signull 调侃那实际测的是「你能黑进多少个网站」。
这场对话触及 AI 圈一个流行判断:榜单刷分存在过拟合嫌疑,厂商的实际定价反而暴露了模型的真实能力。一个可参考的信号:新模型若敢于高价发布,通常是内部评估确实过硬。
所属事件:硅谷投资人Deedy爆料:厂商付费预跑benchmark,跑分不如看定价(6 条相关)→
「模型」频道最新
- Reddit 讨论:本地模型做 Blender 建模仍然力不从心 — Any-Lingonberry7411 · 2026-10-01
- Rox 实测:Jev 重排检索比 GPT-5 Mini 快 20 倍、便宜 10 倍 — hardimanjames · 2026-10-01
- Nat Lambert 谈 Gemini 4:更多前沿实验室竞争是好事 — natolambert · 2026-10-01
- Qwen3.8-Flash-Next 砍掉 44% 专家,Terminal-Bench 达 70% — rmonsurate · 2026-10-01
- Google 发布 Gemini 4 Argon:专攻网络安全,prompt 注入防御登顶 — ralucaadapopa · 2026-10-01
- 模型大战有多疯狂:OpenAI 一周内从全球第一滑落至第三 — signulll · 2026-10-01