JevBench 新增双图表:能力与成本、速度分轴呈现不再合成单一分数
airesearch12 · x · 2026-09-24
Benchmark Heaven 的模型评测站 JevBench 更新了可视化:新增「能力 vs 成本」和「能力 vs 速度」两张独立图表。能力分取 Intelligence 与 Calibration 的均值,而成本与速度各自保留独立坐标轴,避免「便宜但不够好」被混进一个综合数字里模糊判断。
JevBench 还支持大量筛选维度:价格基准(输入/输出混合比例可调)、模型/供应商/实验室归属地(中国、EU、US)、托管区域是否真在 EU、数据保密政策(是否训练或保留你的数据)等,并可将 Benchmaxxing 信号纳入综合分。
「模型」频道最新
- Anthropic 新模型 token 效率大幅提升,任务精度与消耗比更优 — auto_grad_ · 2026-09-24
- GPT-6 系列丢掉了 GPT-5.6 死磕任务到完成的特性 — jdjohnson · 2026-09-24
- philschmid 提及 Gemini 3.8 Flash,建议多模态理解任务就用 Gemini — _philschmid · 2026-09-24
- FLock THIS/THAT 1.2 单次前向决策模型发布,跑分超 Opus 与 GPT — matlabulous · 2026-09-24
- 用户抱怨 Claude 过度过滤:合法虚构内容也拒绝,比 ChatGPT 严苛得多 — Dogbold · 2026-09-24
- 黑客操纵 ChatGPT 与 Gemini 推荐结果,为诈骗中心导流 — ArielSimon · 2026-09-24