OVEarth-Bench开源:172 类遥感开放词汇基准,49 通用+专用模型实测
开放词汇地球观测(Open-Vocabulary Earth Observation, OV-EO)关注从自然语言查询中定位地理空间目标,而不是依赖固定类别表。OVEarth-Bench 面向这一问题构建了一个统一零样本评测基准,覆盖 172 个遥感类别、1,346 个正负开放词汇查询字符串,并同时支持开放词汇、指代表达和推理查询。论文对 49 个通用与遥感专用模型变体进行系统评测,当前最佳方法在三类分割任务上的 ma-IoU 最高分别为 38.75%、41.32% 和 37.96%,说明开放词汇遥感理解仍有较大提升空间。
开源地址:
- ModelScope 数据集:
https://modelscope.cn/datasets/earth-insights/OVEarth-bench - ModelScope 创空间:
https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer - 项目主页:
https://earth-insights.github.io/OVEarth-bench - 论文:
https://modelscope.cn/papers/2607.27278

核心特性
172 类遥感开放词汇评测
OVEarth-Bench 以层级类别体系覆盖植物、商业服务与居住、工业采矿与仓储、交通、地形、水利基础设施和特殊设施等 7 个顶层域,显著扩展了传统遥感评测的类别范围。
三类自然语言查询统一评测
基准同时包含开放词汇短语、基于空间上下文的指代表达,以及不直接命名目标类别的功能性推理查询,用同一套数据评估识别、空间定位和语义推理能力。
520 张新采集 GeoTIFF 图像
图像不复用已有遥感基准,覆盖六大洲,图像宽度从 692 到 4,713 像素,GSD 范围为 0.08 到 305.7 m/pixel,中位数为 0.30 m/pixel。
掩码、水平框和旋转框同时提供
基准包含 590 个 mask 标注,并在可实例化目标上派生 4,810 个检测框,支持分割、检测和视觉 grounding 的统一零样本比较。
49 个模型变体系统评测
实验覆盖对比式开放词汇分割、MLLM 分割、检测与 grounding 模型,以及遥感专用方法,能够比较不同技术路线在同一数据协议下的表现。

OVEarth-Bench 覆盖更宽类别与更多查询形式

OVEarth-Bench 目标类别样例
为什么需要新的遥感开放词汇基准
传统遥感数据集通常绑定固定类别表,例如道路、建筑、船舶或飞机等常见目标。语言条件遥感数据集进一步引入了指代表达或推理描述,但很多资源仍复用公共图像,且类别识别、缺失目标拒识、空间指代和功能推理往往分散在不同数据集中评测。
OVEarth-Bench 将问题重新定义为零样本自然语言定位:模型在推理时不能使用针对该基准的训练、微调或阈值选择,也不限制在预设标签集合内。评测重点从“能否识别少量固定类别”转向“能否在更宽类别空间和更多语言表达形式下稳定定位目标”。

OVEarth-Bench 构建流程
数据构建:先定义语义范围,再采集图像
层级类别体系
类别设计在图像采集前完成,避免只收集容易找到或容易标注的目标。体系参考了中国土地利用现状分类标准 GB/T 21010-2017、EarthNets 中 200 多个遥感数据集的类别清单,以及 OpenStreetMap 标签,用于补齐细粒度和长尾遥感概念。
POI 引导图像采集
所有图像均为新采集遥感图像。构建流程通过 POI 检索与 QGIS 工具定位候选区域,再在对应坐标处裁剪图像 patch。图像以 GeoTIFF 格式保存,保留坐标元数据,便于后续溯源和扩展。
人工 mask 标注与复核
标注员为目标绘制多边形 mask。几何结构简单的目标可先由 SAM 2 生成初始 mask,再由人工检查和修正;复杂或边界模糊目标则完全人工标注。标注经理会复核类别、边界质量和漏标情况。
LLM 辅助查询生成与人工质检
每个标注会生成开放词汇短语、指代表达、推理查询和负样本候选。第二阶段自动检查负样本是否实际出现在图中,并修正指代表达中的空间错误。自动检查发现 3.9% 的负样本候选实际存在,28.6% 的指代表达需要空间纠正;最终仍由 3 名专家完成质量复核,其中 57.3% 的指代表达被修改或移除,16.0% 的负样本短语被修改。

OVEarth-Bench 标注统计
评测协议:同时看定位、拒识和语言泛化
OVEarth-Bench 定义三类任务。开放词汇任务同时包含正向短语和负向短语,模型既要定位存在目标,也要拒绝图中不存在但视觉或概念相近的候选目标。指代表达任务要求模型根据空间上下文定位目标。推理任务不直接给出类别名,而是用目标功能或用途描述进行定位。
分割任务报告 macro Precision、macro Recall 和 macro IoU,避免大面积目标主导指标;同时报告 micro IoU。检测任务报告 mi-P、mi-R、mi-F1@0.5,以及 0.5 到 0.95 IoU 阈值下的平均 mi-F1。开放词汇任务额外报告 MCC,用于评估正负查询上的存在性判断,而不是只看定位质量。
实验条件保持统一:49 个模型均以零样本方式评测,不在 OVEarth-Bench 上训练、微调或选择阈值;检测模型输出通过 SAM 提示生成 mask,并在分割评测中合并为单个二值 mask;论文主表中的框定位结果使用 HBB 作为通用输出格式。
性能表现:MLLM方法领先,但整体上限仍低
测试条件:所有模型均在 OVEarth-Bench 上进行零样本评测,不进行训练、微调或阈值选择;使用原论文或官方实现的默认超参数;检测指标按 IoU 0.5 与 IoU 0.5:0.95 计算。
| 模型 | 开放词汇分割 ma-IoU | 指代表达分割 ma-IoU | 推理分割 ma-IoU |
|---|---|---|---|
| Rex-Omni+SAM | 38.75 | 41.32 | 37.96 |
| SAMTok-Qwen3-VL-4B-co | 33.31 | 40.21 | 35.07 |
| X2SAM | 31.82 | 32.86 | 36.08 |
| Sa2VA-Qwen3-VL-4B-SAM3 | 30.45 | 35.04 | 34.11 |
| SegEarth-R2 | 25.51 | 19.77 | 22.52 |
上表数据来自论文主实验,数值单位为百分比。Rex-Omni+SAM 在三类分割任务上均取得最高 ma-IoU,但最高值仍低于 42%,说明当前方法距离稳定开放词汇遥感定位仍有明显差距。
| 查询类型 | mi-F1@0.5 最佳模型 / 得分 | mi-F1@0.5:0.95 最佳模型 / 得分 |
|---|---|---|
| 开放词汇 | Rex-Omni / 24.53 | LocateAnything / 14.23 |
| 指代表达 | LocateAnything / 35.56 | LocateAnything / 21.47 |
| 推理查询 | LocateAnything / 26.12 | LocateAnything / 14.91 |
检测与视觉 grounding 结果同样显示出挑战性。开放词汇、指代表达和推理查询下的最佳 mi-F1@0.5 分别为 24.53%、35.56% 和 26.12%,当 IoU 阈值提高到 0.5:0.95 平均指标时,最佳结果进一步下降到 14.23%、21.47% 和 14.91%。
关键发现
开放词汇遥感仍未解决
即使最强模型在三类分割任务上领先,绝对性能仍然有限。遥感图像中的目标尺度变化、旋转方向、密集小目标和长尾类别,使开放词汇定位比通用自然图像场景更难。
MLLM 方法整体表现最强
MLLM-based 方法在开放词汇分割前十名中占 9 个席位,并包揽指代表达和推理任务前十名。这说明更大规模的多模态预训练与指令调优,对长尾类别表达、空间关系理解和功能性描述有明显帮助。

模型类型构成与规模差异诊断
遥感专用模型整体表现不佳
遥感专用方法可以在部分对比中超过相关通用基线,例如 SegEarth-OV 超过 ClearCLIP,LAE-DINO+SAM 超过 GroundingDINO+SAM。但在 OVEarth-Bench 上,最佳遥感专用结果仍远落后于整体最佳方法,说明领域适配需要与更强的通用多模态能力结合。
窄类别集合会导致排名不稳定
论文通过反复采样较小类别集合分析模型排名稳定性。当只使用 5 个类别时,子集排名与全量排名的 Spearman ρ 中位数为 0.84,Top-5 恢复率中位数为 0.6;当类别数增加到 50 时,Spearman ρ 中位数提升到 0.98。宽类别覆盖对于可靠比较开放词汇模型是必要条件。
定位能力不等于拒识能力
MCC 结果普遍偏低,绝大多数模型的MCC不超过 0.35。开放词汇 ma-IoU 与 MCC 的排名相关性仅为 Spearman ρ=0.107,说明能定位存在目标,并不代表能可靠拒绝不存在目标。

类别规模对模型排名稳定性的影响
创空间体检:在线浏览520张图像与标
OVEarth-Bench Annotation Explorer 已在 ModelScope 创空间上线,适合快速查看数据集标注形式和任务差异。创空间基于 Gradio 5.49.1 构建,仓库内置 ground_truth.json,启动前会从 earth-insights/OVEarth-bench 数据集下载完整 images.zip,并将 520 张 GeoTIFF 图像解压到持久化本地存储。启动完成后,用户切换图像时直接从本地读取,不需要逐图下载。
操作流程包括三步。打开创空间后,先在 1. Task 下拉框选择三类任务之一:open_vocabulary、referring 或 reasoning;再在 2. Image file 中选择或搜索图像路径,例如 images/42.tif;最后在 3. Query / annotation 中选择具体查询,点击 Load image and visualize annotation 即可查看标注可视化。
可视化结果中,红色表示 segmentation mask,黄色表示 horizontal box,青色表示 oriented box。下方 Annotation details 会展示所选 ground truth 的结构化信息,包括任务名、查询内容、图像路径、图像尺寸、类别名、bbox、oriented bbox 和 COCO compressed RLE 格式的 segmentation 信息。开放词汇负样本查询不会绘制几何标注,因为该查询目标在图中缺失,关联标注只用于定位同图中的另一个对象。
链接:https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer
CLI 与 Python SDK
OVEarth-Bench 已发布在 ModelScope 数据集仓库,开发者可以通过 ModelScope CLI 或 Python SDK 下载到本地,用于零样本评测、数据浏览和后续方法开发。首次使用前建议升级 modelscope,避免旧版本 CLI 或 SDK 不支持数据集下载参数。
通过 ModelScope CLI 下载:
pip install -U modelscope
modelscope download --dataset earth-insights/OVEarth-bench --local_dir ./OVEarth-bench
如果只需要下载图像归档或标注文件,可在数据集页面查看文件列表后指定文件名下载:
modelscope download --dataset earth-insights/OVEarth-bench images.zip --local_dir ./OVEarth-bench
通过 Python SDK 下载:
from modelscope import dataset_snapshot_download
dataset_snapshot_download(
dataset_id='earth-insights/OVEarth-bench',
local_dir='./OVEarth-bench'
)
下载完成后,可结合论文发布的 ovearth-eval 评测包复现实验指标,也可以使用 ModelScope 创空间先在线查看样例图像、查询文本和 mask/box 标注结构。
研究总结
OVEarth-Bench 把开放词汇遥感评测拆成类别广度、查询多样性、空间定位和存在性判断等多个维度,并在同一零样本协议下比较 49 个模型变体。当前最佳分割 ma-IoU 仍低于 42%,检测定位指标也处于较低区间,说明遥感开放词汇理解仍处在快速发展阶段。当前在遥感数据上训练的各类分割和检测模型,表现不如最新的通用MLLM。后续方法需要同时利用通用 MLLM 的语言与视觉泛化能力,以及高质量遥感语料和精细空间标注,才能在真实遥感场景中获得更稳定的开放词汇定位能力。
在魔搭社区科学智能专区,发现更多科学数据集
OVEarth-Bench 的数据集类型为科学数据集。通过在创建数据集(或数据集设置页面),修改类型为科学数据集,指定学科分类,会被收录到科学智能专区(https://modelscope.cn/nexa),被更多科研工作者发现。

点击跳转体验链接
https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer
更多推荐




所有评论(0)