专题 · FULL STORY
openjev 开源潮:从模型涌现到评测榜单
openjev 类开源模型在社区集中涌现,爱好者自发整理近 20 个项目并建榜;随后开发者发布开源基准 JevBench v1.2,为这一类型化决策模型生态提供统一评测,事件从模型爆发走向标准化。
2026-09-19 ~ 2026-09-21 · 2 集 · 6 条
第 1 集 · 社区涌现近20个 openjev 模型,爱好者自发建榜(2026-09-19,4 条)
openjev 类开源模型近日在社区大量涌现,已知项目包括 system-one-open、openjev-sglang、Needle 3、Bespoke Nimble 等近 20 个。一位独立爱好者自费在 benchmarkheaven 搭建排行榜并于当日首发,最初的评分方案为准确率、速度、成本各占 33%,随后作者改稿提高准确率权重,理由是造一个极便宜但极不准的模型太容易,并决定新增概率校准维度。
- 社区涌现近20个 openjev 模型,爱好者自费建榜今发首个排行榜 — airesearch12 · 2026-09-19
- openjev 排行榜即将首发,已收录十余个开源变体 — EuclidStellar · 2026-09-19
- benchmarkheaven 评测方案:准确率/速度/成本各占 33% — airesearch12 · 2026-09-19
- openjev 基准改稿:提高准确率权重,新增概率校准维度 — airesearch12 · 2026-09-19
第 2 集 · JevBench v1.2 开源发布决策模型评测榜单(2026-09-21,2 条)
开发者 fstandhartinger 在 GitHub 发布开源基准测试 JevBench v1.2,专注评测「Jev 类」类型化决策模型。榜单方法论将 Intelligence、Calibration、Speed 与成本四项指标各占 25%,权重可配置,通过给模型输入特定任务进行测试,为类型化决策模型提供标准化比较工具。
- JevBench 开源:专注类型化决策模型的评测基准 — sull · 2026-09-21
- JevBench v1.2 开源:智能/校准/速度/成本各占 25% 的可配置榜单 — airesearch12 · 2026-09-21