DiffSynth-Studio 团队开源 DiffSynth-WebUI,一套可私有化部署的扩散模型 LoRA 训练界面。它把魔搭 AIGC 专区背后的训练引擎搬到本地,训练 Krea2、MiniMax H3、Qwen-Image 等主流模型的 LoRA 无需写 Python 脚本、改 YAML 或记命令行参数,数据不出本机、权重私有。

当前支持 20 个模型系列、100+ 套训练配方,并支持在 24GB 显存上通过动态 NF4 量化训练 10B 以上的大模型。

开源地址

● 代码仓库:
https://github.com/modelscope/DiffSynth-WebUI

● DiffSynth-Studio:
https://github.com/modelscope/DiffSynth-Studio

● 灵感流:
https://www.modelscope.cn/gallery/DiffSynth-Studio/d0eda1e9-e05a-4e67-ace5-bf199648ab03

 

为什么需要本地训练器

魔搭 AIGC 专区已提供在线 LoRA 训练服务,选底模、传图片、点几下即可出 LoRA,门槛很低。但部分场景需要更强的本地掌控力:数据涉密不能上云、训练需跑在自有显卡上、权重要留在本地反复迭代等等。DiffSynth-WebUI 面向的正是这类需求,同一套训练引擎,跑在自己的机器上。

 

动态 NF4 量化:24GB 训 10B+ 模型

在 24GB 显存预算下训练 10B 以上模型的 LoRA,同类工具较常见的做法是 8-bit 量化,DiffSynth-WebUI 支持做到 4-bit。

它基于 DiffSynth-Studio 的 diffsynth.core.quant 量化框架,用 bitsandbytes NF4 对冻结底模做动态量化:权重以 4-bit 紧凑格式常驻显存,前向时按需反量化。量化层前向可微,梯度能穿过 4-bit 底模到达 LoRA 分支,因此无需精度补偿模块,直接注入 LoRA 即可训练,导出的 LoRA 权重仍为全精度。

此外可用 exclude_modules 精细控制量化范围,把调制、时间步嵌入、输入/输出投影等小而敏感的层排除在外、保留原精度,让 4-bit 压缩集中在占参数量大头的注意力和 FFN 层。在界面中,这一步只需勾选 NF4 复选框并填写要排除的模块名。

从数据集到 LoRA:100+ 配方,标注与采样都在页面里

DiffSynth-Studio 对新模型的支持会直接映射为 WebUI 里的可选项,20 个模型系列、100+ 套配方覆盖图像、视频、音频三类生成任务:

  • 图像生成:Qwen-Image 一个家族即有 15+ 种配方(基础版、Edit 版、Layered 分层控制、Distill 蒸馏版等),另有 FLUX.2、Z-Image、ERNIE-Image、Boogu-Image;
  • 视频生成:Wan 系列 20+ 种配置,涵盖 T2V / I2V / VACE / Animate / Dancer 等文生视频、图生视频与可控生成,另有 LTX-2、MiniMax-H3;
  • 音频生成:提供 Ace-Step 等音乐/音频模型。

每套配方预设了 LoRA 目标模块、分辨率、学习率与数据集字段,选模型 → 选数据集 → 其余保持默认即可跑通第一轮训练,需要深调时参数也都在页面上。

数据集与自动标注

支持图像、视频、音频三种数据集,以 metadata.jsonl 组织样本并支持自定义扩展字段,无需手动裁剪或缩放,训练时按配置分辨率自动处理。自动标注可接入任意 OpenAI 兼容的多模态模型,批量生成或改写样本描述,标注完直接进入训练,不必在标注工具与训练工具之间倒腾数据。

训练后即时采样

训练结束后,WebUI 会自动用最新 Checkpoint 生成验证样本,采样参数已在配方中定义,只需填写 Prompt,在任务详情页即可判断该轮 LoRA 是否值得保留。

快速上手

git clone --recurse-submodules https://github.com/modelscope/DiffSynth-WebUI.git
cd DiffSynth-WebUI
pip install -e DiffSynth-Studio/
pip install -e .
bash training_ui/launch.sh
# Windows: powershell -ExecutionPolicy Bypass -File .\training_ui\launch_windows.ps1

 

打开 http://127.0.0.1:8100/dashboard,五步跑通第一个 LoRA:

● Datasets → Create Dataset,选 Image,导入几十张图片

● 点 Auto-Caption 批量生成描述(先在 Settings 里配好标注模型),或手写 Prompt

● New Task:选模型 → 选 GPU → 选数据集 → 其余保持默认;按需勾选 NF4 并填写要排除的模块名

● 点 Create Task,进详情页查看日志与 Loss 曲线

● 训练完成后在页面底部下载 *.safetensors,并查看采样结果

显存不足时用免费 AMD 实例

Qwen-Image、MiniMax-H3 等模型仅 bf16 权重就有数十 GB,本地显存不足时可将训练放到云端。ModelScope Notebook 提供 AMD GPU 环境,单卡显存 192GB,预装 ROCm + PyTorch,无需自行配置驱动与依赖。参加「AMD 与 ModelScope 联合开发者激励计划」可获得 AMD 100-1000 小时限时免费 GPU 算力。

使用路径是三步:领取 AMD 免费 GPU 资源,在「我的 Notebook」创建实例并选择 AMD GPU 环境,启动后按 04 节命令部署 DiffSynth-WebUI,或直接打开上文的灵感流链接一键运行。

Notebook 入口:
https://modelscope.cn/my/mynotebook

 

活动参与方法:
https://mp.weixin.qq.com/s/zxzI

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐