Lightricks 开放 LTX-2.5 模型权重。这是 LTX-2 音视频生成模型的最新版本,参数规模为 22B,可根据文本、图像和视频输入生成同步音画。相比 LTX-2.3,LTX-2.5 进一步更新视频解码、提示词理解和蒸馏流程,并新增原生多镜头、自动时长预测、4K HDR 与 RAW 工作流等能力。模型同时提供面向微调的 Dev 权重和固定 8 步推理的 Distilled 权重。

  • 模型权重:https://modelscope.cn/models/Lightricks/LTX-2.5
  • GitHub:https://github.com/Lightricks/LTX-2
  • Blog:https://ltx.io/model/ltx-2-5

📎ltx25-official-hero.mp4

 

核心更新

新的 Diffusion Video Decoder,改善动态画面

LTX-2.5 使用新的扩散视频解码器替换此前的 VAE 重建阶段,重点改善人脸、纹理、画面文字和运动中的可见瑕疵。在越野摩托穿过泥水的官方案例中,画面同时包含高速主体运动、飞溅泥点、积水和镜头跟随。

📎ltx25-cleaner-motion.mp4

原生多镜头,一次生成连续场景

LTX-2.5 支持在一次生成中组织多个相互衔接的镜头,并在切镜后延续人物、环境、光照、声音和视觉风格。Lightricks 以极光下的探索者展示了同一段视频内的景别变化与镜头衔接。

📎ltx25-multishot.mp4

复杂 Prompt 理解更完整

模型使用定制的 Gemma 4 12B 文本编码器,并加入 Prompt Enhancer,用于处理多人物、动作、镜头运动和光照要求等复杂描述,减少长提示词中的指令遗漏。

📎ltx25-prompt-adherence.mp4

根据动作自动判断视频时长

LTX-2.5 新增可选的 Duration Predictor。用户不手动指定帧数时,模型可以根据提示词中的动作判断所需时长,再设置生成帧数,使镜头长度与动作节奏更匹配。

📎ltx25-auto-duration.mp4

面向专业制作的 4K HDR 与 RAW 工作流

官方还展示了原生 4K HDR 和 RAW/EXR 工作流,面向调色、合成等后期制作环节。该能力对应完整的模型与制作流程,本地可达到的分辨率、速度和显存占用仍取决于权重格式、VAE、上采样流程和硬件配置。

📎ltx25-native-4k-hdr.mp4

 

技术细节

新的扩散视频解码器

LTX-2.5 使用 Diffusion Video Decoder 将视频潜变量还原为最终画面,替代此前的 VAE 重建阶段,改善了人脸、纹理、画面文字和运动稳定性。权重包同时提供速度优先的卷积 VAE,用户可以根据画质、速度和显存条件选择解码方式。

提示词增强与自动时长预测

模型使用定制的 Gemma 4 12B 文本编码器,并加入 Prompt Enhancer,将复杂提示词转换为模型使用的条件信息。可选的 Duration Head 则根据提示词中的动作预测所需帧数:未指定 num_frames 时自动确定片段长度,手动指定后则按用户设置生成。

Diffusion Fidelity Rendering

LTX-2.5 引入 Diffusion Fidelity Rendering,根据场景复杂度分配渲染计算。官方表示,该方法用于在控制计算开销的同时保持逐帧像素质量。

📎ltx25-diffusion-fidelity-rendering.mp4

 

开源模型权重

开源模型权重

说明

ltx-2.5-22b-dev-transformer-bf16

完整模型,面向高质量流程与微调

ltx-2.5-22b-distilled-transformer-bf16

固定 8 步蒸馏版,CFG=1

ltx-2.5-22b-distilled-transformer-comfy-int8-convrot

蒸馏版 DiT(Comfy int8 + convrot)。仅限 ComfyUI,不适用于 ltx-pipelines / PyTorch。

ltx-2.5-22b-dev-transformer-comfy-int8-convrot

完整版 DiT(Comfy int8 + convrot)。仅限 ComfyUI,不适用于 ltx-pipelines / PyTorch。

ltx-2.5-22b-distilled-transformer-nvfp4

蒸馏版 DiT(NVFP4)。适用于 ComfyUI,或在 ltx-pipelines 中配合 --quantization nvfp4-prequant 使用(Blackwell / ltx-kernels)。

 

模型下载与推理

LTX-2.5 的 22B Transformer、Gemma 4 12B 文本编码器、视频与音频 VAE 需要分别加载。注意 MoE 式“激活参数”不适用于这里,实际资源需求取决于选用的权重精度、解码器、分辨率、帧数以及是否启用量化和 Offload。

模型下载

魔搭模型:https://modelscope.cn/models/Lightricks/LTX-2.5

pip install -U modelscope
modelscope download \  --model Lightricks/LTX-2.5 \  --local_dir ./LTX-2.5

官方 GitHub 推理

安装官方 GitHub 推理代码

git clone https://github.com/Lightricks/LTX-2.gitcd LTX-2
uv sync --extra nattensource .venv/bin/activate

建议使用 Python >= 3.12、CUDA >= 12.7、PyTorch ~= 2.7。

蒸馏版文本到视频生成


uv run python -m ltx_pipelines.distilled \
  --transformer-path ../LTX-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
  --text-encoder-path ../LTX-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
  --video-vae-path ../LTX-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
  --audio-vae-path ../LTX-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
  --spatial-upsampler-path ../LTX-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
  --duration-head-path ../LTX-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
  --prompt "A golden retriever running through a sunny meadow, cinematic lighting" \
  --seed 42 \
  --output-path output_distilled.mp4

省略 --num-frames 时,模型会调用 Duration Predictor 自动设置时长。手动指定时,帧数必须满足 num_frames % 8 == 1,宽度和高度需要能被 32 整除。

图像到视频生成

添加一个或多个 --image PATH FRAME_IDX STRENGTH 参数(帧 0 表示首帧条件):

uv run python -m ltx_pipelines.distilled \
  --transformer-path     models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
  --text-encoder-path    models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
  --video-vae-path       models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
  --audio-vae-path       models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
  --duration-head-path   models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
  --spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
  --image path/to/first_frame.jpg 0 1.0 \
  --prompt "The camera slowly dollies out as wind moves through the grass" \
  --seed 42 \
  --output-path output_i2v.mp4

 

官方还提供 ComfyUI 工作流和 Lightricks/LTX-2.5-Diffusers 权重。完整说明:

 

ComfyUI 集成

https://docs.ltx.video/open-source-model/integration-tools/comfy-ui

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐