新基准 JevBench:综合智能、校准、速度与成本评模型
rohanpaul_ai · x · 2026-09-20
新基准 JevBench 针对“有界软件决策”类模型输出设计,配套 TypeSafe 9 月 15 日发布的 Jev:输入应用状态与固定选项,返回带概率的类型化答案而非开放式文本。
- 评分同时纳入智能、校准、速度与成本四项,因为部署时高准确率仍可能失败
- 用几何平均防止单一维度的优异表现掩盖短板
- 结果示例:GPT-5.6 Luna 在困难用例准确率上明显高于 Jev 1.13.0,但 Jev 因延迟、校准与成本优势在综合分上领先
- 作者强调这只证明狭义 typed-decision 工作负载的表现,不等于 Jev 综合能力更强
所属事件:JevBench 基准首测发布,242 项决策对比九模型(7 条相关)→
「研究」频道最新
- 亿级规模 arXiv 完整数据集登 Hugging Face 热门榜 — secemp9 · 2026-09-20
- 谷歌 ScientistTwo 自主改进 86/107 个 ML 问题,成功率 80.4% — rohanpaul_ai · 2026-09-20
- 谷歌 ScientistTwo 论文:全自主多智能体框架产出可发表级研究 — rohanpaul_ai · 2026-09-20
- Gated Recurrent Transformer:3层循环深度模型打平12层GPT-2 — burny_tech · 2026-09-20
- 斯坦福造出 3.7 万 AI 科学家智能体虚拟药企 — Dr_Singularity · 2026-09-20
- 理论计算机学者自嘲:一年前质疑 LLM 证明猜想,如今已被打脸 — burny_tech · 2026-09-20