Benchmaxxing 警报:刷榜满分模型真实任务表现平平
airesearch12 · x · 2026-09-19
Benchmark Heaven 网站提出「Benchmaxxing」概念:模型在人人引用的公开榜单上拿满分,在无法提前刷题的真实任务上却表现平庸。该站提供最详细的成本-能力对比分析,功能包括:
- 综合 A-A Coding Agent、Design Arena、Epoch ECI 等多榜排名,可将 Benchmaxxing 信号纳入评分
- 灵活的成本口径设置(输入/输出价格配比 1:0 到 100:1)
- 按 OpenRouter 实测 token 消耗计算任务成本
- 可按托管地区(EU/US/中国)、数据保密政策、开源与否等维度过滤模型与供应商
对评估模型「榜单成绩 vs 实际价值」提供了系统工具。
所属事件:Benchmark Heaven 上线:800 模型跑分与真实成本一站式对比(12 条相关)→
「模型」频道最新
- 51 分钟微调的 GLiNER 完胜 Jev:专用分类器碾压通用模型 — rickasaurus · 2026-09-19
- Jev 对比详细评测出炉:120 条导航路线加 4400 个决策案例 — paraschopra · 2026-09-19
- 上海AI Lab 开源 744B MoE 模型 Atria Dawn,256K 上下文 MIT 协议 — AdinaYakup · 2026-09-19
- 实测称 Jev 处理 384 条新闻仅花 $0.19,比 Claude Opus 5 便宜约 390 倍 — airesearch12 · 2026-09-19
- Jev 开放权重并加入视觉能力,用 Gemma 4 26B-A4B 零标注分类 1697 场活动 — alexcovo_eth · 2026-09-19
- 网友称 DeepSeek Flash 便宜但 token 消耗大,性价比存疑 — oran_ge · 2026-09-19