JevBench 开源:专注类型化决策模型的评测基准
sull · x · 2026-09-21
开发者 fstandhartinger 在 GitHub 发布了 JevBench,一个针对 "Jev 类" 类型化决策模型的基准测试。
- 测试方式:给模型输入一段状态与有界评分规则(rubric),要求模型返回带类型的答案,并为每个选项给出概率——不产生散文输出,无需解析。
- 评测对象:包括 TypeSafe AI 的 Jev 模型在内,但项目声明与该公司无关联。
- 当前版本:v1.2.3,公开了结果文件(RESULTS-v1.2.md)、数据集(含 "hard tier" 的构建说明)及交互式结果页面 benchmarkheaven.com/jev-models。
- 综合评分:JevBench Score 由智能、校准(calibration)、速度等维度构成。
所属事件:JevBench v1.2 开源发布决策模型评测榜单(2 条相关)→
「研究」频道最新
- RL 大佬 Szepesvári:「证明易懂度」没有唯一标量度量 — CsabaSzepesvari · 2026-09-21
- 315 万篇 arXiv 论文全量打包上架 HuggingFace,共 16TB — udmrzn · 2026-09-21
- 用《星际争霸:母巢之战》测模型:Codex Astra 100% 胜率登顶 — steipete · 2026-09-21
- JevBench v1.2 开源:智能/校准/速度/成本各占 25% 的可配置榜单 — airesearch12 · 2026-09-21
- MICCAI 2026 教程将讲解 zeta scaling law 与学习曲线数学 — PTenigma · 2026-09-21
- 不用微调:4B 验证器定位隐藏失败,让长程 Agent 更可靠 — teortaxesTex · 2026-09-21