Benchmark Heaven 上线:聚合 100 项基准、800 个模型,首创 Benchmaxxing 分数
airesearch12 · x · 2026-09-18
开发者 airesearch12 发布模型评测聚合站 Benchmark Heaven(beta),核心亮点:
- 覆盖 100 个基准、800 个模型,提供综合 Composite Score
- 首创 Benchmaxxing 分数:识别模型是否只刷热门公开基准,在无法「训练针对性」的新/private 基准上露馅,间接检测测试集污染
- 按「每任务成本」而非每 token 定价对比,支持多种输入/输出比例假设
- 支持按托管地区(EU/中国/美国)、数据保密政策、开源与否、是否区分推理模型等多维过滤
配套帖解释了 Benchmaxxing 的动机:模型在人人引用的基准上「99% 准确」,可能只是训练集见过测试题。
所属事件:开发者开源 Benchmark Heaven:聚合百项基准按真实任务成本评测模型(5 条相关)→
「模型」频道最新
- 研究者观察:RL 训练后模型心智理论能力明显变差 — voooooogel · 2026-09-18
- Qwen3.8-27B 无审查量化版登 HF 热榜,主打 agentic 场景 — cyjin-yl · 2026-09-18
- OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥 — DynamicWebPaige · 2026-09-18
- 业内爆料:Grok 4.7 本周发布,OpenAI 新模型接近破解千禧年难题 — haider1 · 2026-09-18
- Jemini 分类模型的四种 Agent 用法:裁判评估、路由、子 Agent 编排 — omarsar0 · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18