原力灵机开源新一代原生具身基础模型DM0.5:真机基准 SOTA!
Dexmal 正式开源新一代原生具身基础模型 DM0.5。作为今年 2 月发布的 DM0 的迭代版本,DM0.5 延续 VLA 架构,以视觉语言模型作为多模态主干,配置 680M Action Expert 生成连续机器人动作,围绕开放指令、长程任务、动态干扰和多本体控制做了系统性升级。在真机 RoboChallenge Table30 v2 上取得 SOTA,综合 Score 54.42;仿真基准 LIBERO、RoboTwin 2.0 上平均成功率分别达到 99.0 与 93.5。
本次开源共包含三个模型:预训练模型 Dexmal/DM05 是面向开放世界机器人控制的通用 VLA 基座,可用于下游任务的微调与推理;Dexmal/DM05-libero 与 Dexmal/DM05-robotwin2 则是在该基座上,分别针对 LIBERO/RoboTwin 2.0 仿真操作任务进行监督微调的模型,可直接用于相应任务的推理与评测,也可作为后续任务适配的初始化模型。

开源地址:
- 模型合集:https://modelscope.cn/collections/Dexmal/DM05
- 代码仓库:https://github.com/dexmal/opendm
- 技术博客:https://www.dexmal.com/blog/dm0.5/index_en.html
- 在线体验:https://maas.dexmal.com/
从 DM0 到 DM0.5:走出实验室,走向开放世界
今年 2 月,Dexmal 发布了第一代原生具身大模型 DM0,也是团队第一个从零开始搭建的具身基础模型。DM0 能够完成可控环境下的一系列复杂动作任务的学习,初步揭示了这套范式在正确的数据、有效的优化以及可靠的评测下的可能性。
但真实世界对机器人提出的要求远高于一个精彩 Demo。它需要真正理解任务的指令,理解”接下来为什么要这样做”,在不同相机视角、不同物体状态、不同环境、不同机器人本体和各类干扰下保持稳定可靠执行,并在少量数据微调后快速适应新的真实任务。
这正是 DM0.5 开发的出发点:走出实验室,走向开放世界。
DM0.5:从当前帧驱动到开放世界理解
DM0.5 延续 VLA 架构,以 4B 视觉语言模型作为多模态主干,并配置 680M Action Expert 生成连续机器人动作。包含三个方向的技术架构创新。

1. Context Abstraction Layer:历史信息融合。 传统模型只看当前画面,DM0.5 通过引入历史帧,让模型在决策时获得一个短期情境记忆,模型会同时接收当前帧和过去若干关键帧,为模型提供长达1分钟的任务进程状态变化,降低了模型对固定历史窗口的依赖,也让模型在历史缺失或部分失效时仍能退化到当前观测策略。
2. Embodiment CoT Tasks:广泛的具身推理。 DM0.5 在机器人数据中引11种不同的自回归任务,使训练不仅依赖连续动作监督,也持续强化指令遵循、动作预测和时序环境感知。把机器人数据从单一动作监督扩展为”指令理解、时序推理和动作生成”的联合监督,从而提升复杂长程任务中的指令遵循、动作连贯性和任务完成率。
3. Trajectory Alignment Layer:动态动作匹配。 机器人数据采集节奏不一,若与固定时间点强绑,模型易学节奏而非任务规律。DM0.5通过动态规划将预测动作与真实轨迹做单调递增匹配,同时兼顾相邻动作的轨迹连续性,既允许速度差异,又避免跳过关键动作。这使模型更关注抓取、放置等核心动作,生成更平滑鲁棒。
模型优化:多源训练与高效推理
DM0.5 的训练策略以多源数据对齐后的混合训练为核心。机器人操作数据构成动作学习的主体,视觉语言数据用于维持视觉主干的开放词表理解和空间推理能力,导航数据提供长指令理解与路径决策监督, 视频理解数据进一步增强模型的时序建模、事件理解和动态场景表征能力。
在优化策略上,视觉语言主干与动作专家采用分组学习率。视觉语言主干使用较小学习率,以降低灾难性遗忘并稳定保留通用视觉语言能力; 动作专家使用更大学习率,以充分学习机器人动作分布。训练过程采用混合精度和分布式训练,并对动作专家进行独立的训练优化, 以支持长上下文、多相机输入和 history token 带来的额外计算开销。
DM0.5 推理以 Action Chunk 为单位执行,默认使用 10 个 diffusion / Flow Matching steps 生成一个 50 步 chunk。 经过优化后,DM0.5 在 4090 单卡上的推理速度能够做到 10Hz,在 H100 单卡上做到 20Hz。
核心优势:面向开放世界的硬实力
1. Zero-Shot能力
实验结果表明,DM0.5在绝大多数评测维度上均显著优于PI05-Droid和DM0,展现出更强的指令理解与执行能力。


2. Fine tuning能力
抓取场景真机测试 RoboChallenge Table30 V2:我们使用 RoboChallenge Table30 v2 评测 DM0.5 的真实机器人桌面操作能力。该评测覆盖多类真实桌面操作场景,包括长期记忆、多步顺序执行、视觉感知与目标定位、精细抓放、工具交互以及双手协同等任务类型。同时,该评测采用 Generalist Setting,每个测试机型训练一个统一模型,能够更加全面地检验 VLA 模型在真实环境中的操作泛化能力。
实验结果表明,DM0.5 在 Table30 v2 上取得了 SOTA 的整体效果,整体 Success Rate 为43%,综合 Score 为54.42。在盖章定位、按按钮等需要记忆目标状态和动作顺序的任务中,DM0.5 的记忆能力显著提升了执行稳定性。模型能够更好地保持中间状态、目标位置和多步操作顺序,从而减少遗忘、重复执行或顺序错误。
同时,依托强大的视觉-语言-动作预训练,DM0.5 在复杂精细操作上也表现出色。对于双手托盘等双臂协同任务,模型能够较稳定地控制相对位姿和运输过程;对于插花等需要物体识别、抓取姿态选择和精细放置的任务,模型展现出较强的视觉 Grounding 和末端控制能力。
总体来看,Table30 v2 的结果说明 DM0.5 不仅在记忆型任务上受益明显,也能在双臂协同和精细操作任务中保持领先表现,验证了其在真实机器人多任务 Generalist Policy 场景下的有效性。

抓取场景仿真测试:我们在两个广泛使用的仿真基准中评估了 DM0.5 的微调能力:单臂操作环境 Libero 与双臂操作环境 RoboTwin2.0。实验结果表明,微调后的 DM0.5 在两类场景中均展现出强大的任务适应能力,并能够达到当前最先进方法的性能水平。

LIBERO

RoboTwin2.0
导航场景仿真测试:我们使用在 R2R 和 RxR 两个基准评测DM0.5在导航上的性能,DM0.5在大多数评测指标上均取得了最佳性能。在 R2R Val-Unseen 数据集上,其 Navigation Error(4.8) 和 Success Rate(59.7) 均达到最高。在更具挑战性的 RxR Val-Unseen 数据集上,DM0.5-Nav 在 所有四项指标上指标上均位居第一,相比所有基线方法均取得了显著优势。

3. 历史记忆能力
历史记忆能力用于衡量模型是否能够将过去观测整合为当前决策的上下文。DM0.5 在 Dexmal-Mirror上构建了两个真实场景实验,分别对应短程情境记忆和长程情境记忆。
“拿起杯子擦桌子”验证了模型能利用近期历史追踪物体状态和任务进度;“模仿人类示范放电池”验证了模型能保留早期示范并将其约束到后续机器人动作中。


4. 策略鲁棒性
相机变化:实验数据显示,尽管第三视角相机的位置发生变化,整体任务成功率仅呈现轻微波动,未出现系统性显著下降,表明模型在不同视角条件下具备较强的鲁棒性。

人为干扰:在 Dexmal-Mirror 机型上,DM0.5 在人为移动目标以及短时遮挡的情况下,仍能保持对当前场景的理解,并持续推进任务流程。当容器位置和朝向发生变化后,模型没有依赖原始固定轨迹,而是根据新的视觉状态重新调整机械臂末端位置与动作方向,继续完成对目标物体的操作。
本地部署
DM0.5 推荐使用 Docker 环境部署,避免宿主机上 CUDA、PyTorch、flash-attn 等依赖版本不匹配。系统要求 Ubuntu 20.04 / 22.04 + NVIDIA GPU,推荐显卡 RTX 4090 / A100 / H100 / H20,训练建议 8 卡,推理单卡即可。
模型下载(以 DM05 主基座为例):
modelscope download --model Dexmal/DM05 --local_dir ./checkpoints/DM05
Docker 环境启动:
git clone https://github.com/dexmal/opendm.git
cd opendm
docker run -it --rm --gpus all --network host \
--name opendm \
--shm-size=16g \
-v "$PWD":/app/opendm \
-w /app/opendm \
dexmal/opendm:latest /bin/bash
conda activate opendm
pip install -e .
启动推理服务
script/dm05_launcher.sh \
--task inference \
--nproc_per_node 1 \
--model-config.model-name-or-path ./checkpoints/DM05 \
--model-config.chunk-size 50 \
--inference-config.port 7891
服务启动后,/process_frame 接受 multipart/form-data 请求,包含任务指令 text、当前机器人状态数组 states 以及各路 RGB 相机图像,返回下一步 Action Chunk。可用如下命令快速验证:
bash tests/curl_demo.sh http://SERVER_IP:7891/process_frame
LIBERO / RoboTwin 2.0 微调模型推理:分别指定对应的实验配置、chunk-size、动作维度与相机键:
# LIBERO(单臂,动作 7 维,2 路相机)
script/dm05_launcher.sh \
--exp playground/dm05_libero.py \
--task inference --nproc_per_node 1 \
--model-config.model-name-or-path ./checkpoints/DM05-libero-bf16 \
--model-config.chunk-size 10 \
--inference-config.output-action-dim 7 \
--inference-config.image-keys images_1 images_2 \
--inference-config.port 7891
# RoboTwin 2.0(双臂,动作 14 维,3 路相机)
script/dm05_launcher.sh \
--exp playground/dm05_robotwin2.py \
--task inference --nproc_per_node 1 \
--model-config.model-name-or-path ./checkpoints/DM05-robotwin2-bf16 \
--model-config.chunk-size 50 \
--inference-config.output-action-dim 14 \
--inference-config.image-keys images_1 images_2 images_3 \
--inference-config.port 7891
完整的训练、评测流程和 benchmark 客户端配置见 OpenDM 仓库的 docs/zh/dm05_libero.md 与 docs/zh/dm05_robotwin2.md。
更多推荐




所有评论(0)