JevBench v1.3.0 上线:原版 Jev 以 74.4 领跑,47 个竞争者逼近
airesearch12 · x · 2026-09-22
JevBench v1.3.0 在 Benchmark Heaven 上线,用于排名「Jev 级」决策模型。原版 Jev 仍以 74.4 分居首,但如今面临 47 个竞争者的挑战,部分已非常接近榜首。榜单支持按价格口径、任务负载、地区(中国/欧盟/美国托管与公司注册地)、数据保密政策、开源与否等多维度过滤,并纳入 Benchmaxxing 信号与 cost vs capability 对比。
所属事件:JevBench 更新至 v1.3.0,原版 Jev 以 74.4 分领跑 47 个竞品(2 条相关)→
「模型」频道最新
- Grok 4.7 发布:编程评测登顶,价格仅对标模型一半 — FinanceYF5 · 2026-09-22
- Grok 4.7 发布:价格不变,Terminal-Bench 成绩从 20.3% 翻倍至 38% — FinanceYF5 · 2026-09-22
- Anthropic 状态页显示 Claude 多个模型错误率升高 — corvad · 2026-09-22
- antirez 与 tenobrus 联手泼冷水:Jev 演示皆夸大,离真可用还远 — burny_tech · 2026-09-22
- 马斯克确认:Grok 90 天从榜外杀回前三,4.8 下月再战 — elonmusk · 2026-09-22
- Anthropic 多款 Claude 模型错误率升高,官方排查中 — ClaudeAI-mod-bot · 2026-09-22