JevBench v1.2 开源:智能/校准/速度/成本各占 25% 的可配置榜单
airesearch12 · x · 2026-09-21
Benchmark Heaven 推出开源排行榜 JevBench v1.2,主打「Jev 类」决策模型评测。方法论:Intelligence、Calibration、Speed、Cost 四项各占 25%,取几何平均作为主分。
特点:
- 基准开源,方法论在页面公开
- 除主分外还提供强调单一维度(编码/智能体/科学/长上下文等)的替代榜单
- 用户可自定义权重生成专属排名
- 支持按托管地区(EU/US/中国)、数据保密政策、是否开源权重、价格口径等过滤模型与提供商
此前 deliprao 质疑其未校准置信度、比较方法不清,作者回应方法论已公开说明。
所属事件:JevBench v1.2 开源发布决策模型评测榜单(2 条相关)→
「模型」频道最新
- Burkov 锐评神秘项目 Jev:号称秒杀 LLM,结论是 BS — burkov · 2026-09-21
- 曝月之暗面与腾讯混元竞逐 Flash 小模型,主攻 Agent 推理成本 — TheZachMueller · 2026-09-21
- 开发者上线 Made With Jev 目录站,汇总模型演示、工具与 Skills 资源 — Sea_Supermarket_5891 · 2026-09-21
- 逆向工程该选哪个模型?开发者求助 Ghidra/IDA 的 MCP 工作流 — obese_coder · 2026-09-21
- JEV「不会幻觉」存疑:同提示多次运行概率不一、选项顺序显著影响输出 — FrankFelixAI · 2026-09-21
- Reddit 用户发现直接调用 Jev 需排候补名单,疑因上周热度爆棚 — Creative-Drawer2565 · 2026-09-21