图像判断基准 ImageJevBench v0.2 发布:573 图,Imajev 4B 居首
airesearch12 · x · 2026-09-30
BenchmarkHeaven 发布图像理解判断基准 ImageJevBench v0.2,基于 573 张新合成图像,含公开/密封题划分与防 Chance-corrected 评分,并分设电脑与浏览器决策两条测试轨道。五模型核心榜中 Imajev 4B 排名第一。基准还同时给出能力-延迟、能力-成本(每千次决策美元成本)的权衡图,复合分由智能、校准、速度、成本四轴构成。新增 browser-use 试点,开始测量模型「看屏幕并执行操作」的能力。发布方披露了模型入选的时间线与一个 checkpoint 404 未评分的情况,声明未针对结果调参。
「模型」频道最新
- 破解「深度诅咒」:Kimi K3、DeepSeek V4 各押注不同残差方案 — FinanceYF5 · 2026-09-30
- 用户按场景拆分 AI 助手:Claude 干活,ChatGPT 装杂事 — enggirlfriend · 2026-09-30
- 曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」 — scaling01 · 2026-09-30
- 开发者实测:GPT-5.6 Sol 发布数周后被悄悄降级性能 — Diveye · 2026-09-30
- DeepSeek 开源全套昇腾版基础组件,多项性能逼近硬件上限 — lxfater · 2026-09-30
- 「不再招动态设计师了」:Opus 5.5 三条提示词做出动态设计 — FinanceYF5 · 2026-09-30