AI AMA@高德DreamX-World
日前,高德 AMAP-ML 团队开源 DreamX-World 1.0 世界模型,用户可通过键盘风格的相机动作与事件提示,对生成的世界进行探索、控制和变换,最长可在 16 FPS 下流式生成约 1 分钟的可交互视频。
魔搭社区有幸邀请该工作核心作者 田瑞田、宋秉泽、张慎 3位老师做客“AI模型社”直播间,系统分享DreamX-World 背后的关键设计,特精选15条精彩 AMA 内容,与大家分享~
1、从 Wan2.2-TI2V初始化时,哪些能力是直接继承的,哪些能力必须重新训练出来的?
答:轨迹控制能力,Wan2.2本身是没有的,它可能只能通过Prompt来控制。但是Prompt在5秒视频里可能不会那么精准,精准的轨迹控制能力还是要重新训练的。另外Wan2.2-TI2V原生应该只能支持121帧的推理,长视频的能力他也是没有的,也得从头训练。还有他的记忆能力可能也不会那么好,因为只有在长视频的时候,可能是吸引能力才会才会有所体现。
2、ue 数据里有 first-person、third-person、event 三类子集,对模型能力的贡献是拆开的?比如第一人称主要提升镜头控制,第三人称主要提升角色跟随
答:对模型能力的贡献是拆开的。比如第一人称能力主要是提升镜头控制,第三主要是前置决策模型。
3、真实世界视频和游戏视频的 camera pose 坐标系不同,你们统一坐标系时遇到的最大坑是什么
答:最主要的是对真实世界是用了Mast3r来抽的坐标位置。最UE的位置和Mast3r是不一样的。最大的问题前期的你要先了解你每个数据集,如果有固定的坐标位置,你现在要知道它的坐标系是什么。最终训模型训练的时候是统一到了OpenCV坐标系。坐标系统一是比较精确的,最后转换成统一的OpenCV坐标系,送入模型去学习就可以。最大的问题在于平舆尺度的处理方向。
4、E-PRoPE 相比完整PRoPE,把空间token从18480降到4096,这个4096 是怎么选出来的
答:做了对比的相同实验,发现在保留20% Token的时候,能够保证精度不下降,且速度相对比较快。4096的值是最终的模型要保证能够在打卡上并行。所以最终保留的20% token最好能够被八整除。
5、AR rollout 的 chunk size 怎么选?
答:尝试过三合一,如果是一的话,它误差已经会特别大。最后还是选择的是三,对 chunk size 的三。
6、事件提示和camera action冲突时,比如用户让镜头后退但事件发生在前方,模型优先听谁的
答:优先听轨迹控制的,以模型的轨迹控制能力为主。
7、互联网数据需要计算相机位姿嘛,如果需要的话,这部分数据和ue数据的相机位姿是怎么统一的?感觉这两个坐标系不一定是一致的。
答:是用max项目来抽的。如果需要这部分数据和优异数据,上次未接同意的,刚才所说的,会把它统一转换到OpenCV下。模型只会输入的坐标系对。
8、camera的速度是怎么控制的?
答:因为实际上抽取取得出对于视频抽取的相机位置已经涵盖了不同的速度速度表示这样在推这样这样模型已经学会处理不同速度。在退的时候,可以改变每一帧的相对位移的数值,进而达到你每一帧移动不同的位置,进而达到控制开幕速度的方式。
9、推理能否不传入文本,仅仅传入wasd视角控制信息和首帧图? 效果如何?
答:输入一段简单的场景描述,输入一句话的简单场景描述,就可以通过WASD来控制场景漫游的效果。但如果效果最好的话,还是要输入一下Prompt。
10、强化学习 数据是怎么标的?
答:没用DPO来训练,用的是Distribution FT。这部分只需要一些输入数据就可以。所以数据没有没有进行什么标注,是只是用一些模拟的轨迹,还有手针,还有Prompt就直接进行训练的。
11、你们怎么判断一次 DMD 蒸馏已经过强?
答:当时训练了2000个step,每100个保存一次。过了一下测评过了一下长视频测评,30秒的长视频测评,选择了一个定量指标最好的。
12、教师模型是 bidirectional E-PRoPE model,学生是 AR model。教师本身没有 AR history,为什么还能有效监督长视频student?
答:是对一个局部的窗口进行一个分布匹配蒸馏,目的为了让窗口的视频能够有一个正常的颜色表现。因为如果你student模型,这种误差累积很容易把导致长视频再推移到后半部分的时候,整个画面都崩掉了。教室模型提供的是画面质量的一个提升,而不是这种history的这方面的提升。所以教师模型本身它是没有长视频能力的,只会在5秒的窗口里进行DME的监督。
13、如果overall是平均值,是否会掩盖世界模型真正重要的短板,比如 memory consistency 或者 camera controllability?
答:比如memory consistency或者说camera control。首先memory consistency是额外的一个表格去去评测。也把所有的指标全部都列出来了。因为整个真正的事件模型,它不仅是要看啊视频质量,还要看控制这些能力。最终的overall要把整个这些东西全部都算一个平均值,看一看最终综合的表现。
至于说camera的话也可以单独看。比如说我们在5秒上,我们的效果是要比其他模型好的。但是说在30秒上我们现在的模型是要比例或者说混混元wordplay分数是要是要低一些的对,如果说具体要做某一个点的提升,那就要看那一点的性能了。
14、不同场景 scale 差异很大,translation error 如何做 scale-invariant normalization?
答:不太清楚场景,比如说是指那种教堂的场景,或者说其他风景图的一个场景。基本上算的是对于同样的一个场景,对于是在对于同样的一个场景,三个关系分别跑,他们会会得到一个分数,去看啊他们的因为会也会卡一个对于场景下会卡一个阈值。比如说有的模型OK它就是1,有的模型不OK它就是0。所以说在同一个场景下做综合的一个做公平的一个对比。
15、你们扩充了 upward tilt、downward tilt、diagonal movement 等轨迹,这些动作中哪一种对现有模型最难?
答:应该说往上点头,往往上看,往下看,或者说对角线的移动。从我实际的评测上面来看,应该说这种上下点头的是更难做的。因为发现不管是在在这三个模型中,这种上下点头的,他那个指令的咨询能力都不是特别好。但是diagonal的这种效果还是挺好的。
直播完整回放
高德DreamX-World: 实时可交互世界模型
www.bilibili.com/video/BV1t5Tk6JEg8?spm_id_from=333.788.videopod.sections&vd_source=06c185c644ac8c37e76462ffffc0b9e6
更多推荐




所有评论(0)