H3-World 开源:基于 MiniMax-H3 构建的交互式世界模型,让 MiniMax-H3 支持角色与相机控制
H3-World 是首个基于 MiniMax-H3 构建的交互式世界模型。给定同一张首帧图像,模型可以根据不同的按键序列,生成对应的角色移动与相机运动。
该工作将视频模型已有的语言动作理解用于控制,通过轻量微调,只用 8k 条数据和 0.199% 的可训练参数,在保留底模原有的生成能力的同时,使模型拥有角色和相机控制能力。

H3-World
H3-World 将角色与相机动作转换为文本指令,沿用 MiniMax-H3 预训练的文本处理路径,并通过定向注意力将指令与对应的视频潜变量区间对齐。在此基础上使用轻量 LoRA 适配,没有新增专门的动作控制模块,实现了对运动方向和发生时间的控制。
模型下载:
https://modelscope.cn/models/DANNY621/H3-World
技术报告:
https://modelscope.cn/papers/2609.01560
Github:
https://github.com/Danzer1xxxxChan/H3-World
Project:
https://danzer1xxxxchan.github.io/H3-World
效果展示
同一首帧,不同动作
H3-World 使用 W、A、S、D 表示角色控制,I、J、K、L 表示相机控制,F 表示快速相机运动。在固定首帧、随机种子和采样配置的对照中,改变控制指令即可得到站立、前进、左右侧移,以及不同方向和速度的相机运动。

动作切换与组合
控制指令不仅可以作用于整段视频,也可以按时间变化。例如,先向左转动相机,再切换为向右转动。模型还展示了训练中未出现过的动作组合:将已学到的角色移动与相机转动、俯仰组合起来,在游戏场景和新的视觉场景中生成相应运动。

跨场景与视角迁移
官方案例覆盖第一人称与第三人称视角,以及室内、户外、科幻和幻想场景。以下视频展示了同一套控制接口在不同初始画面中的应用。
霓虹街巷,第一人称视角下的相机快速右转:

提灯洞穴,第一人称视角下的向左侧移:
沙漠绿洲,第三人称视角下的向右侧移:

幻想建筑中的骑士,第三人称视角下的相机上仰:

技术解读
复用 H3 的语言动作理解
官方表示,未经动作控制训练的 MiniMax-H3,已经能够根据文字生成大致符合要求的角色和相机运动。例如,下图分别给出角色向前移动、相机向左转动,以及武士向前迈步、相机跟随的结果。H3-World 在此基础上,将整段视频的粗粒度语言控制扩展为按时间安排的动作控制。

动作指令与视频时间区间逐一对应
下图展示了 H3-World 的完整处理流程。
(a)模型先将角色和相机按键分别转写为短句,再组合成文本动作指令;每个视频潜变量(latent)区间对应一条独立指令,经过 H3 编码器和两层 Token Refiner 处理后,与场景信息、首帧条件及待生成的视频潜变量拼接为统一序列。
(b)该序列沿用 MiniMax-H3 的单流 Transformer 进行处理,不额外增加独立的动作控制模块。
(c)模型通过定向注意力,将每条动作指令直接连接到对应的视频潜变量区间,同时保留视频潜变量之间原有的双向注意力,其他时间区间则不能直接读取这条指令;训练时仅在自注意力投影和 Token Refiner 中加入 LoRA,使模型学习动作指令与画面运动之间的对应关系。

轻量 LoRA 适配
训练时,H3-World 冻结原有模型参数,在自注意力的 QKV、输出投影及两层 Token Refiner 中加入 LoRA,继续使用 H3 原有的去噪训练目标。研究选取 8,000 段视频,其中 7,872 段用于训练、128 段留出评估;rank-32 LoRA 训练 10,000 步,可训练参数占比为 0.199%。
训练动作覆盖
动作接口由 9 类角色指令和 16 类相机指令构成,其中 135 种组合符合控制规则。训练集覆盖 83 种,其余 52 种未出现。

不同动作条件注入方式对比
官方报告还比较了三种动作条件注入方式:将按键编码为向量后直接加到视频特征中(Additive bias)、通过 FiLM 对特征进行缩放和平移,以及 H3-World 的文本动作接口。
下图最上方为原始视频,下面依次为三种方法的生成结果。
在这段留出视频及相同记录动作序列的对照中,前两种方式出现了较弱或不一致的动作响应,H3-World 则生成了协调的角色与相机变化。这一结果说明可以通过 H3 已有的文本路径传递动作条件。

模型下载与使用
H3-World 权重已上线魔搭社区。本次提供的是 LoRA,需要与 MiniMax-H3 基础权重及 H3-World 的定向注意力补丁配合使用。
环境准备
官方环境使用 Python 3.10、CUDA 12.8 和 PyTorch 2.10.0。
获取代码并安装依赖:
git clone https://github.com/Danzer1xxxxChan/H3-World.git
cd H3-World
conda create -n minimax_h3 python=3.10 -y
conda activate minimax_h3
pip install torch==2.10.0 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
pip install modelscope
获取指定版本的 DiffSynth-Studio:
git clone https://github.com/modelscope/DiffSynth-Studio.git DiffSynth-Studio-h3-v2
git -C DiffSynth-Studio-h3-v2 checkout "$(cat code/diffsynth_base_commit.txt)"
git -C DiffSynth-Studio-h3-v2 apply ../code/diffsynth_h3_action.patch
source env.sh
模型下载
H3-World:https://modelscope.cn/models/DANNY621/H3-World
MiniMax-H3 基础模型:https://modelscope.cn/models/MiniMax/MiniMax-H3
modelscope download \
--model DANNY621/H3-World \
--local_dir ./checkpoints/H3-World
modelscope download \
--model MiniMax/MiniMax-H3 \
--local_dir ./DiffSynth-Studio-h3-v2/models/MiniMax/MiniMax-H3
生成动作控制视频
下面使用仓库附带的首帧图像,生成角色向前移动的视频。输出为 832 × 480、124 帧、24 fps,时长约 5.2 秒。
python3 code/abot/infer.py \
--checkpoint checkpoints/H3-World/step-10000.safetensors \
--first-frame examples/first_frame.png \
--scene-prompt "A man in a yellow floral shirt stands in a dim, multi-level concrete parking garage." \
--action-preset forward \
--seed 2 \
--steps 50 \
--num-frames 124 \
--cfg-scale 1.0 \
--out outputs/example_forward.mp4
上述示例按预设动作生成视频片段,并非实时键盘交互。按键与语言的完整映射见项目中的 code/abot/action_script.py。
更多推荐




所有评论(0)