开放词汇地球观测(Open-Vocabulary Earth Observation, OV-EO)关注从自然语言查询中定位地理空间目标,而不是依赖固定类别表。OVEarth-Bench 面向这一问题构建了一个统一零样本评测基准,覆盖 172 个遥感类别、1,346 个正负开放词汇查询字符串,并同时支持开放词汇、指代表达和推理查询。论文对 49 个通用与遥感专用模型变体进行系统评测,当前最佳方法在三类分割任务上的 ma-IoU 最高分别为 38.75%、41.32% 和 37.96%,说明开放词汇遥感理解仍有较大提升空间。

 

开源地址:

  • ModelScope 数据集:
    https://modelscope.cn/datasets/earth-insights/OVEarth-bench
  • ModelScope 创空间:
    https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer
  • 项目主页:
    https://earth-insights.github.io/OVEarth-bench
  • 论文:
    https://modelscope.cn/papers/2607.27278

 

核心特性

172 类遥感开放词汇评测

OVEarth-Bench 以层级类别体系覆盖植物、商业服务与居住、工业采矿与仓储、交通、地形、水利基础设施和特殊设施等 7 个顶层域,显著扩展了传统遥感评测的类别范围。

 

三类自然语言查询统一评测

基准同时包含开放词汇短语、基于空间上下文的指代表达,以及不直接命名目标类别的功能性推理查询,用同一套数据评估识别、空间定位和语义推理能力。

 

520 张新采集 GeoTIFF 图像

图像不复用已有遥感基准,覆盖六大洲,图像宽度从 692 到 4,713 像素,GSD 范围为 0.08 到 305.7 m/pixel,中位数为 0.30 m/pixel。

 

掩码、水平框和旋转框同时提供

基准包含 590 个 mask 标注,并在可实例化目标上派生 4,810 个检测框,支持分割、检测和视觉 grounding 的统一零样本比较。

 

49 个模型变体系统评测

实验覆盖对比式开放词汇分割、MLLM 分割、检测与 grounding 模型,以及遥感专用方法,能够比较不同技术路线在同一数据协议下的表现。

 

 

OVEarth-Bench 覆盖更宽类别与更多查询形式

 

 

 

OVEarth-Bench 目标类别样例

 

为什么需要新的遥感开放词汇基准

传统遥感数据集通常绑定固定类别表,例如道路、建筑、船舶或飞机等常见目标。语言条件遥感数据集进一步引入了指代表达或推理描述,但很多资源仍复用公共图像,且类别识别、缺失目标拒识、空间指代和功能推理往往分散在不同数据集中评测。

OVEarth-Bench 将问题重新定义为零样本自然语言定位:模型在推理时不能使用针对该基准的训练、微调或阈值选择,也不限制在预设标签集合内。评测重点从“能否识别少量固定类别”转向“能否在更宽类别空间和更多语言表达形式下稳定定位目标”。

 

OVEarth-Bench 构建流程

 

数据构建:先定义语义范围,再采集图像

层级类别体系

类别设计在图像采集前完成,避免只收集容易找到或容易标注的目标。体系参考了中国土地利用现状分类标准 GB/T 21010-2017、EarthNets 中 200 多个遥感数据集的类别清单,以及 OpenStreetMap 标签,用于补齐细粒度和长尾遥感概念。

 

POI 引导图像采集

所有图像均为新采集遥感图像。构建流程通过 POI 检索与 QGIS 工具定位候选区域,再在对应坐标处裁剪图像 patch。图像以 GeoTIFF 格式保存,保留坐标元数据,便于后续溯源和扩展。

 

人工 mask 标注与复核

标注员为目标绘制多边形 mask。几何结构简单的目标可先由 SAM 2 生成初始 mask,再由人工检查和修正;复杂或边界模糊目标则完全人工标注。标注经理会复核类别、边界质量和漏标情况。

 

LLM 辅助查询生成与人工质检

每个标注会生成开放词汇短语、指代表达、推理查询和负样本候选。第二阶段自动检查负样本是否实际出现在图中,并修正指代表达中的空间错误。自动检查发现 3.9% 的负样本候选实际存在,28.6% 的指代表达需要空间纠正;最终仍由 3 名专家完成质量复核,其中 57.3% 的指代表达被修改或移除,16.0% 的负样本短语被修改。

 

OVEarth-Bench 标注统计

 

评测协议:同时看定位、拒识和语言泛化

OVEarth-Bench 定义三类任务。开放词汇任务同时包含正向短语和负向短语,模型既要定位存在目标,也要拒绝图中不存在但视觉或概念相近的候选目标。指代表达任务要求模型根据空间上下文定位目标。推理任务不直接给出类别名,而是用目标功能或用途描述进行定位。

 

分割任务报告 macro Precision、macro Recall 和 macro IoU,避免大面积目标主导指标;同时报告 micro IoU。检测任务报告 mi-P、mi-R、mi-F1@0.5,以及 0.5 到 0.95 IoU 阈值下的平均 mi-F1。开放词汇任务额外报告 MCC,用于评估正负查询上的存在性判断,而不是只看定位质量。

 

实验条件保持统一:49 个模型均以零样本方式评测,不在 OVEarth-Bench 上训练、微调或选择阈值;检测模型输出通过 SAM 提示生成 mask,并在分割评测中合并为单个二值 mask;论文主表中的框定位结果使用 HBB 作为通用输出格式。

 

性能表现:MLLM方法领先,但整体上限仍低

测试条件:所有模型均在 OVEarth-Bench 上进行零样本评测,不进行训练、微调或阈值选择;使用原论文或官方实现的默认超参数;检测指标按 IoU 0.5 与 IoU 0.5:0.95 计算。

模型 开放词汇分割 ma-IoU 指代表达分割 ma-IoU 推理分割 ma-IoU
Rex-Omni+SAM 38.75 41.32 37.96
SAMTok-Qwen3-VL-4B-co 33.31 40.21 35.07
X2SAM 31.82 32.86 36.08
Sa2VA-Qwen3-VL-4B-SAM3 30.45 35.04 34.11
SegEarth-R2 25.51 19.77 22.52

 

上表数据来自论文主实验,数值单位为百分比。Rex-Omni+SAM 在三类分割任务上均取得最高 ma-IoU,但最高值仍低于 42%,说明当前方法距离稳定开放词汇遥感定位仍有明显差距。

查询类型 mi-F1@0.5 最佳模型 / 得分 mi-F1@0.5:0.95 最佳模型 / 得分
开放词汇 Rex-Omni / 24.53 LocateAnything / 14.23
指代表达 LocateAnything / 35.56 LocateAnything / 21.47
推理查询 LocateAnything / 26.12 LocateAnything / 14.91

 

检测与视觉 grounding 结果同样显示出挑战性。开放词汇、指代表达和推理查询下的最佳 mi-F1@0.5 分别为 24.53%、35.56% 和 26.12%,当 IoU 阈值提高到 0.5:0.95 平均指标时,最佳结果进一步下降到 14.23%、21.47% 和 14.91%。

 

关键发现

开放词汇遥感仍未解决

即使最强模型在三类分割任务上领先,绝对性能仍然有限。遥感图像中的目标尺度变化、旋转方向、密集小目标和长尾类别,使开放词汇定位比通用自然图像场景更难。

 

MLLM 方法整体表现最强

MLLM-based 方法在开放词汇分割前十名中占 9 个席位,并包揽指代表达和推理任务前十名。这说明更大规模的多模态预训练与指令调优,对长尾类别表达、空间关系理解和功能性描述有明显帮助。

 

模型类型构成与规模差异诊断

 

遥感专用模型整体表现不佳

遥感专用方法可以在部分对比中超过相关通用基线,例如 SegEarth-OV 超过 ClearCLIP,LAE-DINO+SAM 超过 GroundingDINO+SAM。但在 OVEarth-Bench 上,最佳遥感专用结果仍远落后于整体最佳方法,说明领域适配需要与更强的通用多模态能力结合。

 

窄类别集合会导致排名不稳定

论文通过反复采样较小类别集合分析模型排名稳定性。当只使用 5 个类别时,子集排名与全量排名的 Spearman ρ 中位数为 0.84,Top-5 恢复率中位数为 0.6;当类别数增加到 50 时,Spearman ρ 中位数提升到 0.98。宽类别覆盖对于可靠比较开放词汇模型是必要条件。

 

定位能力不等于拒识能力

MCC 结果普遍偏低,绝大多数模型的MCC不超过 0.35。开放词汇 ma-IoU 与 MCC 的排名相关性仅为 Spearman ρ=0.107,说明能定位存在目标,并不代表能可靠拒绝不存在目标。

 

类别规模对模型排名稳定性的影响

 

创空间体检:在线浏览520张图像与标

OVEarth-Bench Annotation Explorer 已在 ModelScope 创空间上线,适合快速查看数据集标注形式和任务差异。创空间基于 Gradio 5.49.1 构建,仓库内置 ground_truth.json,启动前会从 earth-insights/OVEarth-bench 数据集下载完整 images.zip,并将 520 张 GeoTIFF 图像解压到持久化本地存储。启动完成后,用户切换图像时直接从本地读取,不需要逐图下载。

 

操作流程包括三步。打开创空间后,先在 1. Task 下拉框选择三类任务之一:open_vocabularyreferringreasoning;再在 2. Image file 中选择或搜索图像路径,例如 images/42.tif;最后在 3. Query / annotation 中选择具体查询,点击 Load image and visualize annotation 即可查看标注可视化。

 

可视化结果中,红色表示 segmentation mask,黄色表示 horizontal box,青色表示 oriented box。下方 Annotation details 会展示所选 ground truth 的结构化信息,包括任务名、查询内容、图像路径、图像尺寸、类别名、bbox、oriented bbox 和 COCO compressed RLE 格式的 segmentation 信息。开放词汇负样本查询不会绘制几何标注,因为该查询目标在图中缺失,关联标注只用于定位同图中的另一个对象。

 

链接:https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer

 

CLI 与 Python SDK

OVEarth-Bench 已发布在 ModelScope 数据集仓库,开发者可以通过 ModelScope CLI 或 Python SDK 下载到本地,用于零样本评测、数据浏览和后续方法开发。首次使用前建议升级 modelscope,避免旧版本 CLI 或 SDK 不支持数据集下载参数。

 

通过 ModelScope CLI 下载:

pip install -U modelscope
modelscope download --dataset earth-insights/OVEarth-bench --local_dir ./OVEarth-bench

如果只需要下载图像归档或标注文件,可在数据集页面查看文件列表后指定文件名下载:

modelscope download --dataset earth-insights/OVEarth-bench images.zip --local_dir ./OVEarth-bench

通过 Python SDK 下载:

from modelscope import dataset_snapshot_download
dataset_snapshot_download(
    dataset_id='earth-insights/OVEarth-bench',
    local_dir='./OVEarth-bench'
)


下载完成后,可结合论文发布的 ovearth-eval 评测包复现实验指标,也可以使用 ModelScope 创空间先在线查看样例图像、查询文本和 mask/box 标注结构。



研究总结

OVEarth-Bench 把开放词汇遥感评测拆成类别广度、查询多样性、空间定位和存在性判断等多个维度,并在同一零样本协议下比较 49 个模型变体。当前最佳分割 ma-IoU 仍低于 42%,检测定位指标也处于较低区间,说明遥感开放词汇理解仍处在快速发展阶段。当前在遥感数据上训练的各类分割和检测模型,表现不如最新的通用MLLM。后续方法需要同时利用通用 MLLM 的语言与视觉泛化能力,以及高质量遥感语料和精细空间标注,才能在真实遥感场景中获得更稳定的开放词汇定位能力。

 

在魔搭社区科学智能专区,发现更多科学数据集

OVEarth-Bench 的数据集类型为科学数据集。通过在创建数据集(或数据集设置页面),修改类型为科学数据集,指定学科分类,会被收录到科学智能专区(https://modelscope.cn/nexa),被更多科研工作者发现。

 

点击跳转体验链接

https://modelscope.cn/studios/earth-insights/OVEarth-Bench-Explorer

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐