JevBench 首测:242 项决策对比九个模型,准确率最高 97.1%
airesearch12 · x · 2026-09-19
- 作者发布了 JevBench v1,一个针对「Jev 类」类型化决策模型的公开基准:模型接收状态与受限评分规则,输出带概率的类型化答案,无散文输出与解析。
- 评测覆盖 242 项决策、六个任务族,沿五个维度打分:smart(准确率)、cheap(每千次决策成本)、fast(含网络延迟)、reliable(概率校准、改写稳定性、schema 遵守)、open(权重与许可证)。
- 结果:官方 Jev 1.13.0 达 96.3%,成本 $0.027/1k,延迟 0.65s;GPT-5.6 Luna 准确率最高 97.1%,成本 $0.176/1k;最佳开源复现 openjev-sglang 为 95.5%。
- 该基准属 Benchmark Heaven 项目,使用 MIT 协议的开源 harness 与公开数据切分,声明与 TypeSafe AI 无关联;代码与结果已在 GitHub 开源。
所属事件:JevBench 基准发布,242 项决策九模型最高准确率 97.1%(2 条相关)→
「模型」频道最新
- Codex 额度重置恢复,用户称此前几天额度全面耗尽 — CtrlAltDwayne · 2026-09-19
- 传 Anthropic Opus 5.2 纯 JS+three.js 生成 5 分钟泰坦尼克电影 — dotey · 2026-09-19
- 重启会话后模型仍记得 cranberry-42:持久记忆测试趣闻 — RileyRalmuto · 2026-09-19
- 免费模型更笨?反驳帖引论文称 SOTA 模型仍难消除幻觉 — AryHHAry · 2026-09-19
- 为什么 AI 个性同质化?安全训练与依恋恐惧是主因 — alexisgallagher · 2026-09-19
- 新模型 JEV 部分平台免费用,输入 token 低至约 $0.042/百万 — airesearch12 · 2026-09-19