MiniMax H3 开源:通用多模态生成模型,2K 分辨率、原生立体声、最长 15 秒视频
MiniMax 正式开源通用多模态生成模型 H3。H3 能够统一理解跨文本、图像、视频和音频的上下文,生成带原生立体声的视频,最高支持 2K 分辨率、时长可达 15 秒,在指令遵循、文字与品牌标识的准确渲染,以及视频到视频(V2V)的运动迁移方面表现出色,面向广告、品牌、电商、产品设计、UI/UX、游戏等场景。凭借 H3-VAE、H3-Omni Transformer、In-Context Regeneration 等技术,H3 在 2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流模型 720p 的一半。模型权重现已在魔搭社区开放下载。
开源地址:
- 模型下载:https://modelscope.cn/models/MiniMax/MiniMax-H3
- 技术博客:https://www.minimaxi.com/blog/minimax-h3
效果与能力
多素材联合参考
H3 支持组合文本、图像、视频和音频素材,并通过自然语言描述人物、动作、镜头、声音和风格等信息之间的关系。在“全能参考”模式下,单次任务最多可输入 9 张图像、3 段视频和 3 段音频,混合素材总数不超过 12 个;音频需与图像或视频配合使用。
官方展示了一组由视频、图片和音频共同组成的输入素材,并给出了 H3 基于这组素材生成的视频结果。
输入视频
📎h3-motion-camera-reference.mp4
输入图片
输入音频
📎h3-audio-reference.mp3
生成结果
📎h3-multimodal-generated-result.mp4
面向商业内容的生成
H3 覆盖影视、广告、品牌、电商、产品设计、UI/UX 和游戏等内容场景。
MiniMax展示了影视片头、动态海报、电商广告和游戏界面等案例,重点呈现文字、品牌信息、特效、产品和界面元素在视频中的组合生成。
电影片头
📎h3-movie-intro.mp4
游戏UI
📎h3-game-ui.mp4
动态海报
📎h3-dynamic-poster.mp4
广告电商
📎h3-ecommerce-ad.mp4
原生 2K 与双声道音频
H3 单次可输出 4–15 秒视频,帧率为 24 FPS,并在每次生成中包含原生双声道音频。文生视频和全能参考模式支持 21:9、16:9、4:3、1:1、3:4、9:16 等画面比例;首尾帧模式跟随输入图像的原始比例。
2K表现
📎h3-2k-output.mp4
原生双声道
📎h3-stereo-audio.mp4
模型概览
MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。
H3 支持以下输入与输出规格:
- 输出时长:4–15 秒
- 输出宽高比:支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
- 输出分辨率:支持多种分辨率尺寸,默认将较短边设置为 768 像素。使用 H3-Regenerate-2K 可实现 2K 分辨率生成
- 输出帧率:24 FPS
- 输出音频:32 kHz 立体声
- 支持的对话语言:稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对于其他语言,也提供不同程度的支持。
模型版本与输入规格:
① H3-Base-FL2VA
首尾帧模式:支持输入 0 张、1 张或 2 张图像:
- 不输入图像时,为文生视频模式;
- 输入首帧图像时,为首帧生视频模式;
- 输入尾帧图像时,为尾帧生视频模式;
- 同时输入首帧和尾帧图像时,为首尾帧生视频模式
② H3-Base-Ref2VA
全模态参考模式:
- 图像:最多 9 张;
- 视频:最多 3 段;每段时长须为 2–15 秒,总时长不超过 15 秒;
- 音频:最多 3 段。音频必须与图像或视频一同输入,不能作为唯一输入;每段时长须为 2–15 秒,总时长不超过 15 秒;
- 混合输入: 所有类型输入文件合计最多 12 个
完整的 H3 系统由以下三个模块组成:
- H3-Context-IR:随着输入日益复杂,MiniMax构建了一套专门的系统,用于深入理解和提炼输入的多模态指令,并将其转换为 H3 更易于理解、可直接用于生成的形式,即 Context Intermediate Representation(上下文中间表示)。H3-Context-IR 对最终输出质量非常重要。因此强烈建议将 H3-Context-IR API 接入生成流程。或者,可参考提示词指南搭建自己的上下文处理系统。
- H3-Base:根据 H3-Context-IR 的输出生成音频和视频,并输出 768p 分辨率的结果。
- H3-Regenerate-2K:将 768p 的生成结果连同原始上下文一并送回 H3,以 2K 分辨率重新生成输出。这既发挥了 H3 强大的生成能力,又充分利用了原始上下文中蕴含的丰富信息,从而生成细节更准确、视觉保真度更高的高分辨率结果。
模型架构
H3-Context-IR
H3-Context-IR 是一套托管式预处理与编排系统,专为自由形式的多模态输入而设计。
它能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。
H3-Context-IR 会将其对上下文的理解序列化为一种 H3-Base 可接收的结构化表示。在不偏离用户原始意图的前提下,它也可能在适当情况下补充缺失或描述不充分的语义细节。
由于 H3-Context-IR 依赖多阶段工作流,以及多个托管模型与服务,因此不包含在本次开源发布中。官方提供了 API,帮助用户复现官方工作流的行为。同时,官方也提供了详细教程,开发者可以参考提示词指南(链接见下方),构建自己的预处理系统。
- 视频提示词写作指南:https://modelscope.cn/models/MiniMax/MiniMax-H3/file/view/master/docs%2FVIDEO\_PROMPT\_WRITING\_GUIDE\_base\_en.md
- 全参考模式输出指南:https://modelscope.cn/models/MiniMax/MiniMax-H3/file/view/master/docs%2FVIDEO\_PROMPT\_WRITING\_GUIDE\_ref\_en.md
详细使用说明请参阅「推荐工作流——完整 2K 工作流」。
在安全防护机制上,用户提交的文本、图像和视频,以及经过增强的 Prompt,均会接受自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被拦截。官方采用行业标准的过滤措施,但无法完全避免误判或漏判。上述安全防护机制不影响被许可方在MiniMax H3 Community License下应承担的义务,尤其是与合法使用和使用限制相关的义务。
H3-Base
架构概览:
H3-Base 使用不同模态各自对应的编码器或 VAE 进行编码,并将编码后的表示组织成统一的 packed multimodal sequence。随后,通过 RoPE 表达 token 之间必要的空间和时间关系,再将整个序列输入 H3-Omni-Transformer。
具体而言,文本由 H3-Encoder 编码;视觉输入同时由 H3-Encoder 和 H3-VisualVAE 编码;音频则仅由 H3-AudioVAE 编码。
H3-Omni-Transformer 联合预测视频 latent 和音频 latent,随后分别将其解码为视频和立体声音频。
为降低长多模态序列的计算开销,H3 原生支持稀疏注意力训练与推理。首个开源版本仅提供全注意力推理,稀疏注意力实现将在后续更新中发布。
H3-Encoder:
H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的 hidden states 提供给 H3-Omni-Transformer。
H3 在 tokenizer 配置中增加了若干 special tokens,例如 <d>。使用 H3 时,需要采用 H3 仓库中提供的 tokenizer 及相关配置文件。
H3-VAE:
H3 分别使用独立的视觉 latent 和音频 latent 来表示对应模态。
① H3-VisualVAE
- H3-VisualVAE 是一个采用时间因果结构的视频自编码器,空间压缩倍率为 16 倍,时间压缩倍率为 4 倍,latent channel 数量为 24,记作
f16t4d24。H3-VisualVAE 采用了多种 latent space 优化技术,以同时提升重建质量和 latent 的可学习性。 - 在输入 H3-Omni-Transformer 之前,视觉 latent 会按照时间、高度和宽度三个维度,以
1 × 2 × 2的 patch size 进一步进行 patchify。因此,进入 Transformer 的视觉 token 具有等效 32 倍的空间下采样倍率,而时间下采样倍率仍保持为 4 倍。 - H3-VisualVAE 的 latent space 同时针对重建质量和生成模型的易学性进行了优化。在完成 encoder 训练后,官方还进一步训练了一个基于 ViT 的 decoder,以降低解码成本,并进一步提升重建质量。
② H3-AudioVAE
- H3-AudioVAE 使用同一套编码器和解码器分别独立处理左、右音频声道,再将解码后的两个声道重新组合,从而支持立体声音频的输入与输出。
- 对于每个声道,H3-AudioVAE 会将 32 kHz 音频压缩为时间频率为 40 Hz 的 latent token 序列。
- 受 VA-VAE 启发,H3-AudioVAE 对 latent space 进行优化,在保持音频重建质量的同时,使生成模型更容易学习。
H3-Omni-Transformer:
为了实现可扩展性和泛化性,H3 采用了相对简洁的 Transformer block 设计。H3-Omni-Transformer 是一个拥有 33B 参数的 dense、single-stream Transformer,其中约 13B 参数位于与 AdaLN 相关的分支中。由于 AdaLN 的调制输出可以预先计算并缓存,因此在仅用于推理的部署中,无需加载这部分参数。官方发布了完整模型权重,以支持包括微调在内的进一步开发。
attention 层和 FFN 层均不包含 modality-specific 结构。与模态相关的参数仅存在于 input/output layer 和 AdaLN 分支中。特别是,modality-specific AdaLN 能够以相对较低的额外训练和推理成本提升生成质量。
模型使用三维 Multimodal Rotary Position Embeddings(MM-RoPE),表达时间维度和两个空间维度,即 (t, h, w) 上的位置关系。
在训练的最后阶段,MiniMax引入了原生稀疏注意力,以降低长序列的计算开销。稀疏注意力实现未包含在首个开源版本中,将在后续更新中单独发布。
H3-Regenerate-2K
对于 H3 的 2K 分辨率输出,MiniMax没有采用传统的专用超分辨率模块,而是通过 in-context 的方式,使用 H3 基础模型对其自身生成的低分辨率结果进行重新生成。
这一方法具有两方面优势:
- 再生成过程能够最大限度地复用 H3 基础模型已有的生成能力;
- In-context 的形式能够在生成高分辨率输出时再次利用原始多模态上下文,从而还原传统超分辨率方法只能依靠“猜测”来补充的信息,例如小文字和精细细节。
In-context regeneration 也是任务泛化的一个例子。
由于系统较为复杂,该模块目前尚未开源。官方正在完成开源该模块所需的工作,就绪后将第一时间公开发布;同时也提供了一个 API,可用于复现并验证官方的完整生成结果,具体请参阅下方的完整 2K 工作流。
如何本地部署
完整的 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块组成, 完整的 2K 工作流还需要结合官方托管的 H3-Context-IR 和 H3-Regenerate-2K 服务。本部分仅使用本地部署的 H3-Base,对 768p 输出进行验证。
H3-Base 本地部署
MiniMax H3 以两个 task-specific checkpoints 的形式发布,每个 checkpoint 均采用针对具体任务进行 CFG Distillation 的 Omni Transformer 权重。
每个 checkpoint 均以 self-contained 的模型仓库发布,包含推理所需的全部组件:processor、tokenizer、text encoder、Omni Transformer、Visual VAE 和独立 Audio VAE。
H3-Base 目前已支持通过 DiffSynth-Studio、SGLang、vLLM、diffusers 和 ComfyUI 等推理框架和工作流进行部署。
模型下载
modelscope download \
--model MiniMax/MiniMax-H3 \
--local_dir ./MiniMax-H3
DiffSynth 推理
文生视频推理脚本如下:
import torch
from diffsynth.pipelines.minimax_h3_audio_video import MiniMaxH3Pipeline, ModelConfig
from diffsynth.utils.data.audio_video import write_video_audio
from modelscope import dataset_snapshot_download
from PIL import Image
vram_config = {
"offload_dtype": "disk",
"offload_device": "disk",
"onload_dtype": torch.bfloat16,
"onload_device": "cpu",
"preparing_dtype": torch.bfloat16,
"preparing_device": "cuda",
"computation_dtype": torch.bfloat16,
"computation_device": "cuda",
}
pipe = MiniMaxH3Pipeline.from_pretrained(
torch_dtype=torch.bfloat16,
device="cuda",
model_configs=[
ModelConfig(model_id="MiniMax/MiniMax-H3", origin_file_pattern="FL2VA/text_encoder/model*.safetensors", **vram_config),
ModelConfig(model_id="MiniMax/MiniMax-H3", origin_file_pattern="FL2VA/transformer/model*.safetensors", **vram_config),
ModelConfig(model_id="MiniMax/MiniMax-H3", origin_file_pattern="FL2VA/video_vae/source/model.safetensors", **vram_config),
ModelConfig(model_id="MiniMax/MiniMax-H3", origin_file_pattern="FL2VA/audio_vae/model.safetensors"),
],
vram_limit=torch.cuda.mem_get_info("cuda")[1] / (1024 ** 3) - 2,
)
prompt = "A girl is very happy, she is speaking in english: “I enjoy working with Diffsynth-Studio, it's a perfect framework.”"
video, audio = pipe(
prompt=prompt,
height=480, width=832, num_frames=124,
num_inference_steps=50, seed=0,
)
write_video_audio(
video=video,
audio=audio,
output_path="minimax_h3_t2va.mp4",
fps=24,
audio_sample_rate=pipe.audio_vae.sample_rate,
)
SGLang 部署
H3-Base 提供 FL2VA 和 Ref2VA 两个任务变体:前者支持文生音视频及首尾帧生成,后者面向图像、视频和音频等多素材参考生成。
从源码构建 SGLang:
# Use the latest release branch
git clone https://github.com/sgl-project/sglang.git
cd sglang
# Install the Python packages
pip install --upgrade pip
pip install -e "python[diffusion]"
# With uv
uv pip install -e "python[diffusion]" --prerelease=allow
启动 SGLang 服务时,可通过 --model-variant 选择对应变体。
FL2VA:
sglang serve \
--model-path MiniMax/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Ref2VA:
sglang serve \
--model-path MiniMax/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30011 \
--model-variant ref2va
完整的 2K 工作流
本地开源的 H3-Base 负责生成 768p 音视频。完整的 2K 输出需要先通过 H3-Context-IR 整理多模态输入,再由本地 H3-Base 完成基础生成,最后调用 H3-Regenerate-2K API 重新生成 2K 视频。该流程属于本地模型与官方服务组合的混合部署方案,具体调用示例可参考https://modelscope.cn/models/MiniMax/MiniMax-H3
更多推荐




所有评论(0)