openjev 基准改稿:提高准确率权重,新增概率校准维度
airesearch12 · x · 2026-09-19
openjev 基准作者推翻此前准确率/速度/成本各占 33% 的方案,表示会更偏向准确率——因为做一个极便宜但极不准的模型太容易了。同时他意识到还应新增一个维度:模型在概率预测上的准确度(概率校准)。方案仍在打磨中。
所属事件:社区涌现近20个 openjev 模型,爱好者自发建榜(4 条相关)→
「研究」频道最新
- Insilico 发布 4B ADMET 模型:26 项药物安全任务一个模型搞定 — DeryaTR_ · 2026-09-19
- 开发者自制奖励塑形可视化工具,直观对比 GRPO 与 PPO 学习差异 — k7agar · 2026-09-19
- Agent 跑回测没人记录尝试次数:26 个交易台里最狂的一个跑了 113 次 — QuanTradin · 2026-09-19
- 60/60 全跑完却 0/60 正确:Agent 执行成功不等于结果可信 — DMAE1133 · 2026-09-19
- a16z 押注 Vals AI,要做中立可信的 AI 评测黄金标准 — TechCrunch AI · 2026-09-19
- IR 研究者实测 Jev 做 reranker,DL19/20 上效果好且便宜 — beirmug · 2026-09-19