Benchmark Heaven 支持自定义加权:按场景分维度打分模型能力
airesearch12 · x · 2026-10-05
Benchmark Heaven 展示其排名的可定制能力:用户可用滑块按 Intelligence、Calibration、Speed、Cost 加权,自设成本/延迟上限定义「Jev-class」,并以雷达图对比任意两个模型。
一个有意思的设计是按场景与话题分维度打分——「综合最强的模型不一定是适合你的模型」。示例:Jev 在 safety & security 上领先(88.8 vs 52.6),Quyet 在 finance & commerce 上领先(78.2 vs 16.1),routing、legal、moderation、support、guardrails 等维度单独拆分。
所属事件:Benchmark Heaven 推出按场景自定义加权的模型评分(2 条相关)→
「模型」频道最新
- 研究者:人类也很难察觉 AI 的细微模式与分布偏差 — alexisjross · 2026-10-06
- 20美元档三家AI订阅横评:OpenAI最慷慨,Google暗降模型 — bytebot · 2026-10-06
- ChatGPT 伪造《纽约客》漫画还盗用真漫画家签名 — luisdans · 2026-10-06
- 网友预测 Thinking Machines 新模型 fledge alpha 将以 fledgling 之名发布 — willcb · 2026-10-06
- 圈内预言:GPT-6.5 或在 4 周内发布,性能对标 Fable 5.5 — VraserX · 2026-10-06
- Gemini 图像生成额度收紧引用户抱怨,日限成讨论焦点 — BrattyMiku · 2026-10-06