OVEarth-Bench:全新开放词汇地球观测评测基准
earth-insights · hf · 2026-07-31
现有开放词汇地球观测(EO)评测通常受限于狭窄的类别词汇或有限的查询形式。为此,研究者提出 OVEarth-Bench,从两个维度扩展评估:通过广泛的层次化类别覆盖(含正负表达)增加类别广度,通过词汇、指代和推理查询增加查询多样性。
该基准在统一的零样本协议下支持掩码和框定位。评估发现:当前方法性能依然有限;基于多模态大模型(MLLM)的方法取得了最佳整体表现;而EO专用方法通常不如通用模型。
「研究」频道最新
- Meta 提出 ROCS 推荐推理范式,检索 QPS 最高提升 3 倍 — _reachsumit · 2026-07-31
- 强制审稿制度下,AI 学术会议的低质量评审不应再被容忍 — Kwangryeol · 2026-07-31
- HiLaR 框架:用分层强化学习优化 LLM 推荐推理 — _reachsumit · 2026-07-31
- 快手提出反馈驱动框架,将 LLM 推荐策略蒸馏至轻量生成器 — _reachsumit · 2026-07-31
- 腾讯提出 CCFormer:高效长序列建模优化工业推荐系统 — _reachsumit · 2026-07-31
- H3-Omni 架构解析:原生 2K 分辨率与上下文重绘技术 — bdsqlsz · 2026-07-31